Prime Intellect推理平台上线:内部每天已跑近1万亿Token
BiRun 讯,Prime Intellect 发布开源模型推理服务 Prime Inference。
用户可以直接按需调用模型;如果任务需要长期稳定运行,也可以提前锁定一部分推理算力。接口兼容 OpenAI API,首个公开部署的模型是 GLM-5.3。
这套系统此前已经在 Prime Intellect 内部使用。官方称,它每天处理接近 1 万亿 tokens,用于强化学习、合成数据、模型评测和 Coding Agent。Prime Intellect 从今年 1 月起也一直在为客户运行大规模部署。
Prime Inference 重点优化 Agent 的长上下文负载。它把提示词处理和生成回复分到不同 GPU 上,测试中将 p90 token 间延迟降低近 40%。Prime Intellect 还压缩了 KV 缓存,相同显存下,每个解码器可缓存的 token 从 109 万增加到 163 万,提升约 50%。
Prime Intellect 此前已经提供强化学习、评测和沙箱等训练基础设施。加入推理服务后,它可以把模型训练和实际部署接到同一套平台里,实际运行产生的数据也可以继续用于后续训练。
信源
动察 Beating 频道 · 动察 Beating 交流群。
用户可以直接按需调用模型;如果任务需要长期稳定运行,也可以提前锁定一部分推理算力。接口兼容 OpenAI API,首个公开部署的模型是 GLM-5.3。
这套系统此前已经在 Prime Intellect 内部使用。官方称,它每天处理接近 1 万亿 tokens,用于强化学习、合成数据、模型评测和 Coding Agent。Prime Intellect 从今年 1 月起也一直在为客户运行大规模部署。
Prime Inference 重点优化 Agent 的长上下文负载。它把提示词处理和生成回复分到不同 GPU 上,测试中将 p90 token 间延迟降低近 40%。Prime Intellect 还压缩了 KV 缓存,相同显存下,每个解码器可缓存的 token 从 109 万增加到 163 万,提升约 50%。
Prime Intellect 此前已经提供强化学习、评测和沙箱等训练基础设施。加入推理服务后,它可以把模型训练和实际部署接到同一套平台里,实际运行产生的数据也可以继续用于后续训练。
信源
动察 Beating 频道 · 动察 Beating 交流群。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯