资讯 更多 >>
上海人工智能实验室发布多模态语料
长亮科技(300348):8月15日北向资...
第六届研学旅行发展大会在四川蓬溪召开
iPhone 15系列或需专用充电线:苹...
国金证券:给予普洛药业买入评级
世体:内马尔和利雅得新月仅签2年是...
PokeMMO关都地区真新镇旅游指南2023...
国网北京、湖南、浙江电力发布8月不...
辽宁养老金计算公式2023举例 辽宁...
雄安新区:把理论宣讲送到回迁群众...
动态更多 >>
你们,温暖了2021
西安市新增27个中风险地区 目前有1...
广西新增本土确诊病例1例
哈尔滨市全域均为低风险地区
寒潮将影响我国中东部地区 四川盆...
昆明至哈尔滨一航班发现1名入境复阳...
陕西研考:封控区内考生在原报考点...
北京今日最高气温仅5℃ 明起强冷空...
那年今日 | 历史上的12月22日发生...
我要找债主
会展 更多 >>
美籍酿酒师在崇礼:中国是第二故乡...
河南项城报告2名疑似新冠肺炎病例 ...
浙江绍兴确诊病例首次零新增 上虞...
广西东兴实行全员居家隔离 启动口...
新疆全方位推进乡村振兴 “富春山...
云南瑞丽市主城区全员核酸检测结果...
内蒙古满洲里累计治愈出院本土确诊...
孙海洋夫妻驱车山东阳谷:还在为孙...
大国工匠追梦“玉米强国”40载:用...
让南海“海洋热带雨林”斑斓多彩
专题报道 
当前位置: 资讯 > >> 正文
 
上海人工智能实验室发布多模态语料
来源:人民网-人民日报     时间:2023-08-16 07:19:48


(相关资料图)

本报上海8月15日电(记者沈文敏)近日,上海人工智能实验室宣布联合语料数据联盟成员单位,共同开源发布“书生·万卷”1.0多模态预训练语料。

“书生·万卷”1.0集合了语料数据联盟成员丰富的内容积累与上海人工智能实验室的数据处理能力等优势,将为学术界及产业界提供高质量大模型多模态预训练语料。本次开源的数据总量超过2TB,具备多元融合、精细处理、价值对齐、易用高效等四大特征。

本次开源的“书生·万卷”1.0包含文本、图文、视频三部分数据集。其中文本数据来自网页、百科、书籍、专利、教材、考题等,数据总量超过5亿个文档,数据大小超过1TB,覆盖科技、文学、媒体、教育、法律等多个领域;图文数据主要来自公开网页,经处理后形成图文交错文档,总量超过2200万个,数据大小超过140GB(不含图片),覆盖新闻事件、人物、自然景观、社会生活等多个领域;视频数据主要来自中央广播电视总台和上海文广集团,包含新闻、影视等多种类型的节目影像,总计视频文件数超过1000个,数据大小超过900GB,内容覆盖军事、文艺、体育、自然、知识、影像艺术等方面。

《 人民日报 》( 2023年08月16日 12 版)

关注公众号:人民网财经

关键词:

热门推荐
猜你喜欢