引言:百万 Token 时代的到来

2026 年,上下文窗口的军备竞赛从「128K 够不够」变成了「1M 行不行」。据昆仑镜 AI 中心模型库(2026-08 验证),当前主流模型中上下文达到或超过 100 万 token 的已有 16 款:GPT-5.6 家族的 Sol/Terra/Luna(1.05M)、Claude Opus 5 与 Sonnet 5(1M)、Gemini 3.6 Flash 与 3.5 Flash 及 Flash Lite(1.05M)、Kimi K3(1.05M)、GLM 5.2(1.05M)、Qwen3.7 Max/Plus/Flash(1M)、DeepSeek V4 Pro/Flash(1M)、MiniMax M3(1.05M)。

百万窗口意味着什么?以常见中文分词器估算,约 100 万 token 大致对应数十万字到百万字量级的内容——整本长篇小说、整份招股书、整个中型代码仓库,都可以一次性「喂」给模型。把「先检索、再拼装」的流程改为「整库直读」,已经从理论变为现实。

但窗口变长不等于好用。长上下文有四个绕不开的工程问题:检索准确率、长文理解、位置偏差与成本。本文围绕这四个维度构建评测框架,对 16 款 1M 级模型进行数据对比与成本测算。

评测维度:四个实战标尺

  • 检索准确率(needle-in-haystack):在百万 token 的「干草堆」中埋入一句关键信息,看模型能否准确找回。设计上常采用「埋针测试」——在超长文本的随机位置埋入若干条唯一事实,逐段询问模型能否精确复述并给出出处;测试要点是控制变量,针的数量、埋设位置、干扰文本类型都要固定,否则结果不可比。这是长上下文最基础的体检项——窗口再大,找不回信息等于白搭。业界公开评测(公开资料整理)普遍显示,检索准确率随上下文增长而衰减,且与模型架构、位置编码方式强相关。
  • 长文理解:跨章节信息整合、矛盾检测、多跳推理。设计上考察三类任务:把分散在多个章节的事实拼接成答案的信息整合、识别文中自相矛盾表述的矛盾检测、需要连续两步以上推理的多跳问答。这类任务比单纯检索难得多,也是「窗口大」与「读得懂」之间最真实的鸿沟——例如让模型阅读整份财报后回答「三年毛利率变化及原因」,需要模型真正「读懂」而非仅「检索到」。
  • 位置偏差:著名的「迷失在中间」(lost in the middle)现象——模型对开头与结尾内容的利用率显著高于中间段。公开研究(公开资料整理)反复验证了这一现象,且偏差随上下文长度增加而放大;测试设计上应将关键信息分别埋在全文 10%、50%、90% 位置,比较三处的召回差异。对合同、尽调报告这类「关键条款常在中段」的业务,位置偏差直接决定可用性。
  • 成本:长上下文是「输入主导」型负载,百万 token 输入的单次成本由输入价决定,各模型输入价从 0.03 到 20 美元、差距约 667 倍——成本不是次要约束,而是第一约束。

需要说明:本文不编造任何 needle 测试的具体分数;四个维度作为评测框架,模型数据取自模型库的权威能力分与公开标价,具体长文表现需结合自有数据实测。四个维度并非独立:检索失败往往源于位置偏差,位置偏差又直接推高成本(无效输入同样计费)。评测一个长上下文模型,本质是同时考察它的记忆力、理解力、注意力与账单。

参评模型全景:16 款 1M 级选手

模型窗口输入/输出价 (USD/1M)能力分 (中文/推理/代码/质量)
GPT-5.6 Sol1.05M$5.00/$30.0090/98/97/98
GPT-5.6 Terra1.05M$1.00/$6.0088/93/94/94
GPT-5.6 Luna1.05M$0.10/$0.6085/88/90/88
Claude Opus 51M$5.00/$25.0086/97/98/98
Claude Sonnet 51M$2.00/$10.0084/93/94/94
Gemini 3.6 Flash1.05M$1.50/$7.5088/90/90/90
Gemini 3.5 Flash1.05M$1.50/$9.0087/89/89/91
Gemini 3.5 Flash Lite1.05M$0.30/$2.5085/84/86/85
Kimi K31.05M$20.00/$100.0096/95/96/96
GLM 5.21.05M$0.72/$2.2594/92/92/93
Qwen3.7 Max1M$1.48/$4.4395/92/91/93
Qwen3.7 Plus1M$0.32/$1.2894/88/89/89
Qwen3.7 Flash1M$0.03/$0.1392/82/86/84
DeepSeek V4 Pro1M$0.435/$0.8795/92/93/93
DeepSeek V4 Flash1M$0.14/$0.2896/85/88/86
MiniMax M31.05M$0.30/$1.2093/91/92/91

结构观察:

  • 16 款模型中,除 Kimi K3 外,其余 15 款输入价均低于 5 美元——1M 级长文的「平民化」已全面落地,价格不再是长上下文的门槛,质量与稳定性才是。
  • 窗口同为 1M 级,价格横跨三个数量级:输入价从 0.03 到 20 美元,输出价从 0.13 到 100 美元。
  • 能力分层明显:中文维度 Kimi K3(96)与 DeepSeek V4 Flash(96)并列最高;推理维度 GPT-5.6 Sol(98)、Claude Opus 5(97)领先;代码维度 Claude Opus 5(98)、GPT-5.6 Sol(97)领跑;质量维度 GPT-5.6 Sol 与 Claude Opus 5(98)并列第一。
  • 一个有意思的现象:1M 窗口不再是旗舰专属——Qwen3.7 Flash、DeepSeek V4 Flash 这类轻量模型同样给到 1M 窗口,「长上下文」正从溢价卖点变成基础配置。
  • 家族矩阵的「三档布局」清晰可见:GPT-5.6 家族以 Sol/Terra/Luna 覆盖 5 到 0.1 美元的输入价区间,Qwen3.7 家族以 Max/Plus/Flash 覆盖 1.48 到 0.03 美元,Gemini 以 3.6 Flash/3.5 Flash/Flash Lite 覆盖 1.5 到 0.3 美元——同一代技术按预算切成三档,用户按任务付费,这本身就是长上下文走向产品化的信号。

长文输入成本测算:百万 Token 文档的真实账单

测算口径:处理一份约 100 万 token 的长文档(输入)+ 生成约 1 万 token 的摘要或结论(输出),成本 = 输入价 × 1 + 输出价 × 0.01。按此口径,单次成本排序如下(按公开标价估算):

模型单次成本(美元)
Kimi K3≈ 21.00
GPT-5.6 Sol≈ 5.30
Claude Opus 5≈ 5.25
Claude Sonnet 5≈ 2.10
Gemini 3.5 Flash≈ 1.59
Gemini 3.6 Flash≈ 1.58
Qwen3.7 Max≈ 1.52
GPT-5.6 Terra≈ 1.06
GLM 5.2≈ 0.74
DeepSeek V4 Pro≈ 0.44
Gemini 3.5 Flash Lite≈ 0.33
Qwen3.7 Plus≈ 0.33
MiniMax M3≈ 0.31
DeepSeek V4 Flash≈ 0.14
GPT-5.6 Luna≈ 0.11
Qwen3.7 Flash≈ 0.03

解读:

  • 同一份百万 token 文档,最贵与最便宜的处理成本相差约 670 倍(21.00 vs 0.03 美元)。
  • 长上下文是典型的「输入主导」负载:输入价直接决定账单规模。Kimi K3 单次成本中约 95% 来自输入侧;而 Qwen3.7 Flash 处理整份文档不足 4 美分。
  • 若业务每天处理 1000 份百万 token 文档:Qwen3.7 Flash 约 31 美元/天,Kimi K3 约 2.1 万美元/天——同样的任务,年度成本差距达数百万美元量级(按公开标价估算)。
  • 注意:以上为公开标价测算,不含缓存命中、批量折扣与企业合同价,实际账单以厂商计费规则为准。

应用场景与选型建议

  • 长文档分析(财报、研报、招股书):中文场景首选 GLM 5.2(中文 94、$0.72/$2.25)与 Qwen3.7 Max(中文 95);成本敏感可下探 MiniMax M3($0.3/$1.2)与 DeepSeek V4 Flash($0.14/$0.28)。以一份 50 万字的招股书为例(按中文约 1 字 ≈ 1 token、各家分词器略有差异估算,约 50 万 token 输入 + 1 万 token 输出):GLM 5.2 约 0.38 美元,DeepSeek V4 Pro 约 0.23 美元,MiniMax M3 约 0.16 美元;而 Kimi K3 约 11 美元、GPT-5.6 Sol 约 2.8 美元。同样的分析任务,成本区间横跨两个数量级,这就是「输入主导」负载的真实账单。
  • 代码库理解:Claude Opus 5(代码 98)与 GPT-5.6 Sol(代码 97)质量领先,适合「整仓读入」式架构评审与跨文件重构;日常代码问答可退到 Qwen3.7 Max 或 DeepSeek V4 Pro。
  • 法律合同审查:合同审查是「位置偏差」重灾区——关键条款常埋在中段。建议质量优先(GPT-5.6 Sol / Claude Opus 5),并配合分段索引策略对冲中间段信息丢失风险;批量尽调可选用 GLM 5.2 / MiniMax M3。位置偏差的对冲手段还包括:把关键内容前置到开头、对中段结论做二次检索确认、或采用「分段多轮询问」而非一次直读。
  • 研究报告与多源信息整合:Gemini 3.6 Flash(四维 88-90 全均衡)与 DeepSeek V4 Pro(93 分、$0.435/$0.87)是「能力与成本双均衡」的代表。
  • 高吞吐批处理流水线:Qwen3.7 Flash、GPT-5.6 Luna、DeepSeek V4 Flash 以个位数美分级别的单次成本支撑日均百万级 token 吞吐,适合摘要、分类、抽取等规模化场景。

长文工程实践:三个配套动作

窗口再大,也不能裸奔。实际落地长上下文应用,通常需要三个配套动作:

  • 分块 + 引用锚点:把长文档切块后按块输入,要求模型输出时携带块编号引用。这既便于人工校验、对冲幻觉,也让「追溯」成为可能——纯靠 1M 窗口直读时,模型往往说不清答案来自哪一页。
  • 摘要金字塔:先对章节做分层摘要,再把「原文 + 摘要」按需送入窗口。对超长输入,这能把 token 消耗压缩数倍,同时保留关键细节——尤其适合预算敏感的中段模型。
  • 上下文预算管理:把窗口内容分为「必读区、参考区、可丢弃区」三级,只把高价值内容送入窗口,避免「什么都塞进去」导致检索准确率与成本双双恶化。

这三条实践的共同点,是把「窗口有多大」的问题转化为「窗口怎么用」的问题——这也是上下文工程的核心思想。实践中三者往往叠加使用:先做预算分级,再对必读区做分块索引,最后用摘要金字塔压缩参考区;一套流程跑下来,视文档结构不同,实际送入窗口的 token 往往能压缩数倍。

技术趋势:从「窗口」到「上下文工程」

1M 窗口的到来并不意味着检索增强(RAG)已死。事实上,行业共识正在形成:RAG 负责「精确命中」,长窗口负责「全局理解」,两者互补而非替代。与此同时,「有效上下文」被反复强调——标称 1M 窗口下,模型真正能稳定利用的信息量往往低于标称值,检索准确率衰减与位置偏差就是证据。从产业视角看,1M 窗口的普及还改变了产品形态:过去必须依赖外部向量库的「文档问答」类产品,现在可以原生支持整文档对话;客服、法务、审计等行业的「喂整本资料再问」交互正在成为默认形态(趋势判断,公开资料整理)。

未来三到五年,长上下文的技术主线将围绕「上下文工程」展开:KV Cache 压缩与量化,目标是让长窗口推理成本随长度近似线性而非超线性增长——否则 1M 窗口的算力账单会吃掉全部业务收益;分层摘要与树状记忆,把百万 token 折叠为可导航的结构化索引;长文评估基准升级,从 needle-in-a-haystack 的单一指标走向多跳推理、矛盾检测、跨章节一致性等真实任务组合;以及「窗口 + 检索」的混合架构——用检索保证精确命中,用窗口保证全局语境。对用户而言,核心建议只有一条:不要为「标称窗口」付费,要为「有效窗口」付费——选型前先用自有文档做小规模实测。

局限性声明与结论

本文评测框架与模型数据来自前述 AI 中心模型库(2026-08 验证),未进行独立 needle-in-haystack 实测;检索准确率、位置偏差等维度以公开研究结论(公开资料整理)与能力分为参照,不构成对具体模型长文表现的定量结论;成本测算基于公开标价,不含折扣与缓存;长上下文质量受实现细节影响,标称窗口不等于有效窗口;模型能力与价格随版本迭代变化。结论:1M 窗口已从「旗舰专属」普及为「基础配置」,但选择长上下文模型的关键变量不是窗口大小,而是「在百万 token 上还能不能稳定工作、以及为此付多少钱」——两者兼得的答案,目前集中在 GLM 5.2、DeepSeek V4 Pro、MiniMax M3 这个区间。一个务实的落地路线是:批量与高频负载先上轻量 1M 模型压成本,复杂与高价值任务保留旗舰窗口兜底质量,再用路由与缓存把两者粘合——长上下文时代的成本控制,本质上是负载分层。

延伸阅读:昆仑镜(aigc.fushtn.com)作为 AI 数字员工办公平台,其 AI 中心提供全球模型能力分与价格的可查询数据,本文全部模型数据均可在该中心溯源。