AI 预训练的进步,其实主要靠数据

BiRun 消息,作者:Dwarkesh Patel 编译:深潮 TechFlow 深潮导读: 过去六年 AI 模型能力突飞猛进,但进步到底来自算法还是数据?这篇文章用一组小规模对照实验给出一个反直觉结论:数据改进带来的算力效率提升是模型改进的 3 倍多。对关注 AI 基础设施投资和前沿实验室竞争的人来说,它揭示了一个被低估的驱动力:数据工程。 过去几年,我们在 AI 领域看到的快速进步,有多少来自数据改进,有多少来自模型改进?这个问题的答案,对前沿实验室的经济模型和未来进步速度都有重大影响。 我们对这个问题进行了相对小规模的调查,专门针对 2019 年到 2025 年的预训练。在这几年中,每年都会有一套新的开源模型方案发表,它总结了当年公开已知的算法调整(例如架构、优化器、初始化、学习率调度、超参数等方面的改进)。与此同时,每年也会出现新的公开数据语料库(由更大规模的抓取以及新的策展、提取、过滤技术产生)。 我们训练了这些代表不同年份水平的模型方案与数据语料库的各种组合,并在不同的训练算力规模下进行(最高到 1e19 FLOPs)。 显然,我们无法通过它们对某个固定数据集的交叉熵损失来比较这些不同模型,因为我们在改变它们所训练的数据集。因此,我们改为根据最终能力来评估这些模型,衡量标准是 OLMES 评估(它汇总了 10 个相对简单的基准,大部分是多项选择问答)。遗憾的是,评估最终能力而不是预训练损失,会给我们的结果增加一些噪音,你会在下面的图中看到这一点,不过我们尝试通过多次随机种子来获得更干净的界限。 我们发现,从 2019 年到 2025 年,在 1e19 FLOPs 的算力预算下,3.24 倍以上的算力效率提升来自数据改进,而不是模型改进(数据为 12.0 倍,模型为 3.7 倍)。 下面这张网格展示了在 3.16e18 FLOPs 算力下,我们训练的模型在最终测试能力上,相对于 2019 年数据加架构基线的提升程度。 我们发现,数据改进和模型改进带来的收益大多是相互独立的,彼此之间没有交互作用(也就是说,实现某项模型改进的收益,不需要依赖某个特定的训练数据堆,反之亦然)。使用线性模型,OLMES 分数中 88% 的方差可以由模型改进和数据改进的加性效应来解释。 讨论作为背景,让我们简要总结一下 2019 年到 2025 年,数据侧和模型侧分别发生了什么变化。 在模型侧,我们从 GPT-2 走到了 OLMo-2,包括优化器、位置编码、归一化、激活函数、初始化等方面的关键创新。 在数据侧,我们 2019 年从 OpenWebText 开始,它只包含 Reddit 上被充分点赞的链接网页,经过去重和过滤后,最终只有大约 90 亿 token(这基本上就是 GPT-2 的训练数据)。到 2025 年,UltraFineWeb 这类开源数据语料库不仅规模大得多(通过对整个互联网的抓取),还使用了复杂得多的过滤方法(例如训练一个分类器,用来预测哪些数据能实际提升模型性能)。 对我们结果的一种朴素解读是:2019 到 2024 年(预训练时代)AI 的大部分进步,其实只是更好的数据工程(提取、策展等),而那一时期所有的模型工作远没有那么重要。 但这可能是看待模型改进价值的错误方式。模型改进的主要贡献未必是算力效率,也就是用更少的 FLOPs 达到相同性能。相反,它首先让更大规模的算力变得可用。随着参数量、上下文长度、运行时长和集群规模扩大,各种问题都容易出故障(梯度爆炸或消失、内存和带宽耗尽、训练变得不可能地慢)。模型研究的很大一部分内容,就是移除或推后这些对扩展。
利多 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯