Vitalik 实测本地模型:上下文拉到十万,输出速度掉三成
据链新闻发布,Vitalik Buterin 在搭载 AMD Strix Halo 的笔电上以 llama.cpp 跑 Qwen 3.8 flash,公布十组实测:短上下文输出每秒 28 至 33 个 token,上下文拉到 10 万时降到 18 至 21。他认为本地模型调度云端查询、避免提问外流的工作流程开始可行。 这篇文章 Vitalik 实测本地模型:上下文拉到十万,输出速度掉三成最早出现于链新闻 ABMedia 。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯