端侧模型首次支持 100 万上下文:讯飞开源了,但你的手机未必跑得动
9 月 1 日,科大讯飞全资子公司「词元星火」开源了两款端侧模型——星火 X2.5-4B 和 X2.5-1.7B。它们身上有个行业第一的头衔:端侧模型里首个原生支持 100 万 Token 上下文。
这个数字需要个参照物才够直观。

主流端侧模型的上下文窗口普遍停在 32K:Qwen2.5-3B、Qwen3.5-4B、Ministral 3 3B 都是 32K;Llama 3.2-3B 标称 128K,但手机上通常只敢开到 2048–4096。星火 X2.5 把这条线拉到了 100 万,差距约 30 倍。
为什么以前做不到
不是不想,是内存扛不住。上下文越长,KV 缓存越大,而手机内存是硬约束。很多部署教程会明确建议:哪怕模型标称支持 32K,手机上也要把上下文限制在 2048 或 4096,否则直接 OOM。
星火 X2.5 用混合注意力架构绕了一部分,再配合覆盖长篇文档、技术资料的千亿 Token 级训练数据,才把百万窗口真正跑通。两款模型基于全国产算力平台完成全流程训练,预训练用了约 20 万亿 Token。
别急着往手机上装
100 万上下文大概率不是给手机准备的。KV 缓存的物理约束并没有消失。

官方场景里,个人办公、代码开发、智能硬件和机器人排在一起,而机器人被单独点名——模型可部署在本体或边缘设备,做操作控制、目标追踪、导航决策。
这些场景的共同点是:内存比手机宽裕、且不能依赖云端。 真正的价值不是「手机上能聊更长」,而是让一台断网的边缘设备,第一次具备基于完整信息的连续理解能力。
还有一层信号

权重、代码、部署文档已在 Hugging Face、GitHub 开源,兼容 vLLM、SGLang、llama.cpp,支持英伟达、华为、海光、后摩等硬件。
另据官方消息,9 月 7 日讯飞将发布旗舰版星火 X2.5,重点升级代码和智能体能力。端侧这盘棋,才刚开始落子。
你觉得 100 万上下文的端侧模型,最先会在哪类设备上跑起来?车机、机器人,还是你身边的电脑?评论区聊聊👇