7月18日下午,以“语料筑基、智生时代”为主题的2026世界人工智能大会语料创新论坛在上海世博中心成功举办。
作为本次大会的重要组成部分,这场专注于语料领域的高端会议传递出明确的产业发展信号:AI领域的竞争正在从参数和算力的比拼转向数据质量和闭环生态的构建。
在论坛上,相关负责人公布了关键数据:截至2026年6月底,全国已建成高质量数据集12万个,总体量超过1565PB,较一季度末增长超60%。7个数据标注先行先试城市累计完成标注规模超119PB,服务425个大模型研发项目,带动相关产业产值达到263亿元。
会上强调,随着人工智能技术从通用大模型向行业应用深化、从数字模拟向物理交互迈进,高质量数据集已成为推动AI发展的关键要素。
为提升语料质量和构建闭环生态,本次论坛提出了六大专项行动:强基扩容、标注攻坚、提质增效、应用赋能、管理服务和价值释放。同时,推出了语料运营公共服务平台2.0版本,首次提出“筛选—转换—合成”的三层十级数据进化路线。
该平台集成了多项创新工具,包括语料FDE工程平台、“老师傅”语料工程化平台和“语匠”专家众包网络,实现了从一次性交付向持续迭代的重大转变。此外,论坛发布了涵盖高端装备、消防、医疗专病等领域的15项团体标准和2项行业标准,全面贯通了语料从采集到运营管理的全生命周期。
多位专家在论坛上深入探讨了数据对人工智能发展的决定性作用。上海人工智能实验室科学家乔宇提出,“数据定智能”是AGI演进的基本原理,认为数据决定了AI系统的上限。复旦大学副校长姜育刚则指出,实现具身智能需要真机操作数据、人类施教数据和仿真合成数据的协同,并强调失败数据对模型优化的重要性。
会上还宣布,人民日报社将建设“AI友好型”主流价值服务平台,致力于构建面向大模型、智能体和数字人的技术标准、数据标准和服务标准体系。该平台旨在帮助人工智能更高效地读取媒体信息,并支持A2A(智能体交互)等新型业务形态的发展。
在经验分享环节,山东港口青岛港展示了通过“老师傅”经验语料化方法,将堆场计划等核心业务经验转化为可重复使用的组织资产,使港口作业效率提升10%。上海交通大学教授杨力则以法律场景为例,展示了通过四步经验蒸馏使法律大模型准确率提高20%以上。
论坛还启动了“DARE GO达·高”跨领域语料征集计划,面向各行业征集包含环境、任务和评价标准的专业难题,旨在推动AI从知识学习向任务解决转变。同时,2026语料风云榜也在论坛期间揭晓。
从一次性交付到数据闭环模式的转变,标志着语料应用进入新阶段。通过采集、加工、使用、评测和再加工的持续迭代,数据与模型、应用场景实现了良性互动,为人工智能的发展注入了新的活力。

观察数据








