万亿参数也救不了脏数据,国内大模型开始返工预训练

BiRun 讯,雷峰网称,过去大半年,多家国内大模型厂商开始重做预训练,问题都指向数据。

一家厂商曾花近一年训练万亿参数模型,实际效果却被参数量只有约 1% 的小模型反超。团队最后发现,问题出在训练数据。网页垃圾、重复语料、低质量标注混进训练集,再大的模型也吃不消。该案例来自匿名信源,具体公司尚未公开。

腾讯混元已经公开重做了一轮。今年 2 月起,团队重建预训练和强化学习基础设施。此前媒体曾披露,老混元存在打榜数据混入训练集、标注规则混乱等问题。新团队重新定数据标准,清洗原有语料,Hy3 也把数据质量和多样性列为主要改进项。

阿里和百度也在加码数据治理。Qwen3 用 Qwen2.5 系列模型清洗文档,还大量补充数学和代码合成数据。文心 4.5 则加入去重、低质量过滤、数据地图和人工复核。两家公司没有公开说自己曾因脏数据返工,但新一代模型都把更多功夫花在了数据处理上。

信源

动察 Beating 频道 · 动察 Beating 交流群。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯