引言:轻量模型的逆袭

过去两年,行业对「模型越大越强」的迷信正在被工程现实修正。云端旗舰模型固然在中文、推理、代码等维度上持续刷新上限,但企业真正头疼的问题往往是另一类:每天数十亿次调用、毫秒级延迟要求,以及「为 10% 的高阶能力付 100% 的账单」的尴尬。端侧与轻量模型正是为这类问题而生——它们把推理从云端 GPU 集群搬回手机、边缘网关和容器,用可接受的精度损失换取数量级的成本下降与延迟改善。

据昆仑镜 AI 中心模型库(2026-08 验证),DeepSeek V4 Flash、Qwen3.7 Flash 与 GPT-5.6 Luna 是当前轻量赛道上最具代表性的三款产品:价格最低的 Qwen3.7 Flash 输入价仅 $0.03/百万 token,能力分最高的 DeepSeek V4 Flash 中文分达到 96,直逼旗舰水平。这三款模型构成了理解端侧 AI 现状的最佳样本。

端侧模型评测:五个维度构成坐标系

端侧评测与云端评测的本质区别在于:云端可以假设算力近乎无限,而端侧的一切都要在资源约束下权衡。以下五个维度构成端侧模型的基本坐标系。

推理速度。 端侧设备没有旗舰级的 GPU 算力,模型必须在 CPU、NPU 或集成显卡上以可用的速度运行。速度通常以每秒生成的 token 数与首 token 延迟衡量:交互式场景要求首 token 延迟足够低,批量场景则更看重吞吐。速度不仅取决于模型本身,还取决于量化程度与推理引擎优化——同一模型在 4bit 量化与浮点精度下的速度可相差数倍(此为工程常识,具体数值依赖硬件,属估算范畴)。

显存占用。 这是端侧部署的第一道门槛。模型权重、KV Cache 与激活值共同决定内存需求,权重又由参数量与量化位宽决定。4bit 量化可将权重压缩至原来的约四分之一(估算区间),使原本无法本地运行的模型勉强挤进消费级硬件。上下文长度同样关键:百万级 token 窗口在端侧几乎不可能完整驻留,实际部署通常截断上下文或采用流式缓存。

精度损失。 量化与蒸馏都会带来能力折损,评测的意义在于量化这种折损:将轻量模型与云端旗舰在统一基准上的能力分差,视为「用精度换成本」的代价。三款轻量模型与各自旗舰——DeepSeek V4 Pro、Qwen3.7 Max、GPT-5.6 Terra/Sol——的能力分差,恰好构成一张可量化的损失表。以中文能力分为例:DeepSeek V4 Flash(96)甚至反超旗舰 DeepSeek V4 Pro(95);Qwen3.7 Flash(92)与 Qwen3.7 Max(95)的差距收窄到 3 分;GPT-5.6 Luna(85)则与 Terra(88)相差 3 分、与 Sol(90)相差 5 分。推理维度是另一番景象:DeepSeek V4 Flash(85)与 Pro(92)相差 7 分,Qwen3.7 Flash(82)与 Max(92)相差 10 分——轻量化对推理链路的伤害,通常大于对语言理解的伤害(均据模型库能力分计算)。

离线能力。 端侧模型的独特价值在于断网可用与数据不出设备。对隐私敏感的场景——医疗记录、金融交易、企业内部文档——数据不出域本身就是刚需,这是任何云端 API 都无法提供的。

成本。 成本包含两部分:单次推理价格与部署总拥有成本。API 价格直接决定批量任务的经济性;本地部署则需计入硬件摊销、电力与运维。轻量模型的定价普遍在 $0.1/百万 token 以下量级,已进入「可以随意调用」的区间。

三款轻量模型的数据画像

DeepSeek V4 Flash:中文最强的轻量选手。 能力分 96/85/88/86,上下文 1M,输入/输出价格 $0.14/$0.28。中文分 96 是当前轻量模型中的最高值,甚至超过多数旗舰;代价是推理与代码分相对平庸。它的定位清晰:以旗舰级中文理解承接高吞吐的文本任务。

Qwen3.7 Flash:极致性价比的走量选手。 能力分 92/82/86/84,上下文 1M,输入/输出价格 $0.03/$0.13——输入价仅为 DeepSeek V4 Flash 的约五分之一(按模型库价格计算)。推理分 82 是三款中最低的,但 92 的中文分与 86 的代码分足以覆盖绝大多数日常任务,是最适合「量大从优」策略的模型。

GPT-5.6 Luna:轻量外壳下的推理偏科生。 能力分 85/88/90/88,上下文 1.05M,输入/输出价格 $0.1/$0.6。有趣的是,Luna 的推理分(88)与代码分(90)反而高于 DeepSeek V4 Flash,中文分(85)则是三款中最低——这与 OpenAI 系模型「推理强、中文弱」的一贯画像一致(据模型库能力分归纳)。其 $0.6 的输出价明显高于前两者,成本结构更偏向输出侧。

横向对比:能力与成本的两难

模型上下文输入/输出价($/1M)中文推理代码质量
DeepSeek V4 Flash1M0.14/0.2896858886
Qwen3.7 Flash1M0.03/0.1392828684
GPT-5.6 Luna1.05M0.1/0.685889088

三个关键观察:其一,中文能力与推理能力在轻量档位呈现明显的反向关系——DeepSeek 系强中文、OpenAI 系强推理,国产开源系(Qwen)居中;其二,质量分与推理分高度相关,说明「稳定输出」仍依赖推理链路的扎实程度;其三,价格带拉得非常开——Qwen3.7 Flash 与 GPT-5.6 Luna 的输入价相差 3 倍以上,而 Luna 输出价是 Qwen3.7 Flash 的 4.6 倍(均按模型库价格计算)。选型的本质不是找「最强」,而是找「够用且最便宜」。

场景适配:谁适合跑在哪里

移动端。 手机端的核心约束是内存与功耗。三款中,Qwen3.7 Flash 与 GPT-5.6 Luna 的轻量定位更契合移动端;DeepSeek V4 Flash 中文质量最高,适合中文输入法、摘要、翻译类应用。移动端通常采用 4bit 量化加截断上下文部署,牺牲部分质量换取可用性。

嵌入式与边缘网关。 工业网关、车载、IoT 设备的算力以 TOPS 计而非 TFLOPS 计(量级描述,属估算),对模型体积极度敏感。Qwen3.7 Flash 因价格最低、权重规模相对可控(据模型定位推断),是蒸馏与量化的首选底模;其 82 的推理分在规则明确的控制类任务中绰绰有余。

批量任务。 数据清洗、日志分类、内容审核、文档批量处理——这类任务对延迟不敏感,对吞吐与单条成本敏感,通常跑在离线管道或异步队列中,峰值并发可控,因此可以放心堆量。DeepSeek V4 Flash 的 96 中文分使中文批量任务质量溢价明显,$0.28 的输出价在批量语境下依然便宜;Qwen3.7 Flash 则适合「质量要求一般但量极大」的场景,例如舆情初筛。

高并发入口。 面向 C 端的实时服务是成本黑洞:每秒请求量(QPS)上去后,旗舰模型的账单以分钟为单位跳动。合理的做法是把轻量模型放在第一层:Qwen3.7 Flash 兜住 80% 以上的常规请求,仅把疑难请求转给云端旗舰;路由决策本身可由规则或小模型完成,额外开销可以忽略(估算)。

端云协同:轻量模型不是替代品,而是入口

端侧与轻量模型的真正价值,不在于取代旗舰,而在于成为流量入口与成本缓冲层。一个实用的路由策略包含三层:第一层,本地或轻量模型处理简单、高频、隐私敏感的请求,利用离线能力与近零边际成本;第二层,基于意图与置信度路由——轻量模型给出低置信度答案时,自动升级到 DeepSeek V4 Pro、Qwen3.7 Max 或 GPT-5.6 Terra 等旗舰;第三层,旗舰模型负责复杂推理、长文生成与代码任务,其输出又可作为轻量模型微调的数据飞轮。

这种「轻量兜底、旗舰攻坚」的混合架构,能把整体推理成本降低一个数量级(典型量级估算),同时保证用户体验不塌方。路由之外,上下文策略同样值得设计:让轻量模型处理对话的多数轮次,仅在关键节点把完整上下文交给旗舰模型重写,既控制成本又保住质量。更进一步,轻量模型的输出日志本身就是资产——用旗舰模型对其输出做离线重写与打分,可以持续蒸馏出更小、更专的领域模型(流程性描述,无具体数据)。对多数企业而言,真正需要问的不是「该买哪个旗舰」,而是「多少流量可以留在轻量层」。

趋势与局限

端侧 AI 的趋势清晰可见:蒸馏与量化技术让小模型的能力分逐年上移,专用 NPU 与统一内存架构让端侧算力不再捉襟见肘,而「模型路由」正在成为与 RAG、Agent 并列的工程基建。可以预见,轻量模型的战场将从「参数少」转向「效率高」——同样的能力分,谁占用的资源更少,谁就赢得部署。另一个值得关注的信号是价格本身:三款轻量模型的输入价最低已到 $0.03/百万 token,推理成本正在从「预算科目」变成「可忽略项」。高频调用将催生新的应用形态——实时翻译、语音助手、随身知识库等此前受成本约束的产品,正在获得重新设计的机会。

需要声明局限:本文能力分与价格均引自昆仑镜 AI 中心模型库(2026-08 验证),反映的是统一评测基准下的相对水平,不等同于任何具体设备上的实测表现;推理速度、显存占用等端侧指标依赖硬件与量化方案,文中仅给出量级与区间估算,选型前应在目标设备上实测验证。端侧 AI 的终极检验,永远在真实设备上,而不在数据表里。