数据成AI核心驱动力
人工智能发展现在已然步入深水区, 并非单纯去比拼算力与参数。国家数据局现下最新数据表明, 高质量数据集已然成为促使技术取得突破的关键变量。要是没有优质数据, 即便模型规模再大也很难实现落地实用。
截至六月的时候, 全国建成了高质量数据集十二万个, 其总量越过了一千五百六十五拍字节。这些数据, 经过了严格的清洗以及标注, 能够直接去服务于四百二十五个大模型的研发还有优化。这可是实实在在的产业基础。
标注城市先行先试
表现抢眼的七个数据标注试点城市, 其标注规模超过一百一十九拍字节, 这些城市率先对标准化流程展开探索, 从而为大模型提供精准的训练素材, 且它们的服务覆盖了包括金融、医疗等在内的多个垂直领域。
正在快速复制推广的是这种试点模式, 集中出力量去解决数据杂乱问题之后, 行业效率有显著提升, 未来会有更多城市加入到这一行列, 一起去构建出完善的数据生态体系。
飞轮效应加速进化
库帕思科技于上海提出一种闭环理念, 该理念涵盖采集、加工、使用、评测以及再加工等方面。语料、模型跟上应用, 这三者构成相互促进的飞轮效应。每一回迭代均能够使AI变得更为聪明, 更加趋近于人类思维。
这种有着持续进化特性的机制, 将以往那种一次性交付的局限给打破了。数据不是一直保持静态的资源了, 而是成为了动态的资产。借助不断地反馈以及优化, AI原生数据的能力获得了实质性的提升, 促使行业整体朝着前方迈进。
平台能力全面升级

正式亮相的语料运营公共服务平台2.0,首创了“筛选、转换、合成”三层十级路线, 具备从规划咨询到数据工程实施的全链条能力, 能帮助行业专家把隐性经验转化成为可用数据。
此一举措对数据新基建的标准予以了重新定义, 先前数据处于分散状况且难以加以运用, 如今借助系统化整合, 达成了高效流转, 这不但使企业获取优质数据的门槛得以降低, 还增强了数据使用的安全性。
标准体系日益完善
本次论坛公布了多项团体以及行业标准, 这些标准覆盖高端装备、医疗、包括物流等在内的八大方向, 标准贯穿数据采集、数据清洗、数据标注、评测整个流程, 以此保证每一步都有章可以遵循。
秉持“一业一方法、一业一指引”这个原则, 以期让标准更具备可以实际操作的特性。这些作为衡量的尺度为“好数据”给出了清晰明确的界定范围。行业里的参与者由此有了统一的表述方式以及规范准则, 进而使得沟通所需的成本得以降低, 技术方面所形成的壁垒也有所减少。
未来展望与建议
上海身为排头兵, 要持续推进“模数共振”, 从而给高质量数据集建设予以示范。后续会施行包含强基扩容、标注攻坚等的六大行动, 进而再度构建数据供给体系。
面对那般巨大的数据需求, 以及飞速的技术迭代, 你觉得普通企业或者个人该怎样参与进去? 是将专业数据予以提供, 还是借助现有工具开展创作? 欢迎在论水区把你的看法予以分享。






