景联文科技高质量大模型训练数据汇总！

news2026/2/11 20:17:32

3月25日，2024年中国发展高层论坛年会上，国家数据局局长刘烈宏在“释放数据要素价值，助力可持续发展”的演讲中表示，中国10亿参数规模以上的大模型数量已超100个。

当前，国内AI大模型发展仍面临诸多困境。其中，较为突出的就是高质量数据集的匮乏，这极大阻碍了大模型效果提升。特别是专业的行业应用数据集，其获取难度更大，这导致大模型可使用的数据量受到限制，进而对大模型效果形成阻碍。

景联文科技是大语言模型数据供应商，致力于为不同阶段的模型算法匹配高质量数据资源。

世界知识类书籍、期刊、论文及高价值社区文本数据：

中文书籍 250万本
高质量外文文献期刊 8500万篇
英文高质量电子书 200万本

教育题库：

千12教育题库 1800万
大学题库 1.1亿，800万带解析
英文题库 500万

专业知识类期刊、专利、代码：

中文数字专利 4000万
程序代码（代码注释） 20万

多轮对话：

文本多轮对话 1500万
中英文剧本（电影、电视剧、剧本杀） 6万

音频数据：

普通话 65万小时

图片生成及隐式/显示推理多模态数据：

图文复杂描述 600万
图文推理问答对 600万

生物数据：

核酸库 4000万
蛋白库 50万
蛋白结构库 19万
通路库 1000万
生信工具

药学数据：

药物研发数据库 1300万
全球上市数据库 80万
一致性评价数据库 25万
生产检验数据库 40万
合理用药 300万
多维文献 1亿
原料药数据库 1100万

化学数据：

化合物数据库 1.6亿
反应信息数据库 4100万
物化性质数据库 1.6亿
谱图数据库 20万
晶体信息数据库 100万
安全信息数据库 180万
商品信息数据库 740万

材料数据：

金属材料数据 20万
纳米材料数据 30万
相图数据 6万
材料性能数据 20万
材料腐蚀数据
表面处理数据
焊接材料数据

专利数据：

全球专利基础著录数据 1.3亿
全球专利原文数据 1亿
全球专利附图数据
全球专利法律状态数据
全球专利法律状态数据
全球专利引文数据
全球专利分类索引数据
全球专利重点申请人工商关联数据
全球生化医药专利深加工数据
全球专利全文数据

医疗器械数据：

国内政策法规数据 3千
行业标准数据
中国医疗器械审评数据 20万
中国医械临床试验数据 5千
全球医械临床试验数据 7万
医用耗材中标数据 1400万
医用耗材带量采购数据 400万
医用设备招投标数据38万

同时景联文科技提供大模型训练数据的标注服务，致力于为全球数千家人工智能从业公司和高校科研机构交付海量、高质量的多模态大模型训练数据。

景联文科技｜数据采集｜数据标注｜大语言模型训练数据

助力人工智能技术，赋能传统产业智能转型升级

文章图文著作权归景联文科技所有，商业转载请联系景联文科技获得授权，非商业转载请注明出处。

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.coloradmin.cn/o/1553672.html

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈，一经查实，立即删除！

景联文科技高质量大模型训练数据汇总！

相关文章

批量剪辑视频，批量调整片头片尾时长，批量剪辑更高效！

一个传入省市区ID的级联框

Dynamo设置按链接视图显示

buy me a btc 使用数字货币进行打赏赞助

BabySQL【2019极客大挑战】

【学习笔记】java项目—苍穹外卖day01

基于单片机环境监测温湿度PM2.5系统设计

30-3 越权漏洞 - 水平越权（横向越权）

五种免费的Python开发环境及具体下载网址

R语言使用dietaryindex包计算NHANES数据多种营养指数（2）

WhatsApp封号怎么办？看看原因与解封方法

编译与链接（想了解编译与链接，那么看这一篇就足够了！）

算法之美：B+树原理、应用及Mysql索引底层原理剖析

安装uim-ui插件不成功，成功解决

伪原创文章生成软件：自媒体文章写作好神器

【Vue3进阶】- 第2学堂小商城实战课程前言

如何在 Ubuntu 安装桌面环境

8.6 循环神经网络的简洁实现

面向对象：继承

PXE批量装centos7系统