DeepSeek计划训练8万亿参数模型,规模直奔现有最大开放模型近3倍

BiRun 讯,DeepSeek 又要把模型做大了。CEO 梁文锋向投资人透露,公司正在训练一个 2 万亿参数模型,之后还计划开发一个 8 万亿参数模型。现有旗舰 V4-Pro 只有 1.6 万亿参数。

8 万亿是什么概念?目前已经公开权重的超大模型里,Moonshot AI 的 Kimi K3 达到 2.8 万亿参数,已经是全球最大的开源模型。DeepSeek 规划中的 8 万亿模型,规模还要再大接近 3 倍。

不过总参数越多,不代表每次运行都要调用全部参数。Kimi K3 就是 MoE 架构,2.8 万亿总参数里每个 Token 只激活 1040 亿。

信源

动察 Beating 频道 · 动察 Beating 交流群。
利多 查看原文
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯