2023 年初,128K 上下文还是旗舰模型的卖点;2026 年,1M Token 已经成了主流旗舰的及格线,甚至出现了 2M 窗口的先行者。窗口扩大一百倍,绝不是简单地"喂更多字"——它牵动位置编码、注意力机制、内存管理、推理成本一整条技术链。本文从技术底座讲到模型格局,再讲评测方法与应用价值,给出一条从 128K 到 1M 的完整路线图。

一、位置编码的进化:从绝对位置到旋转与线性偏置

Transformer 本身不感知顺序,位置编码是它理解语序的根基。早期绝对位置编码把位置信息直接加进词向量,但外推性差——训练没见过 200K 的长度,推理时就崩。两次关键突破改变了格局:

其一是 RoPE(旋转位置编码),把位置信息编码进查询与键向量的旋转角度,让注意力天然依赖相对距离而非绝对位置。RoPE 在保持训练稳定性的同时显著改善了长度外推,成为 2022 年以来绝大多数开源与闭源模型的事实标准。

其二是 ALiBi(注意力线性偏置),不修改词向量,而是直接在注意力分数上按距离叠加线性惩罚——距离越远,注意力被压制得越狠。ALiBi 的优点是对训练长度几乎无外推损失,代价是长距离依赖的表达能力偏弱,更适合对局部性要求高的场景。2026 年的主流做法已不是二选一:RoPE 系模型普遍搭配长度插值(Position Interpolation)与 NTK 缩放,把训练时学到的位置分布"拉伸"到更长的推理区间,这也是许多模型宣称 1M 窗口的核心手段之一。此外,训练侧也在同步升级:超长序列训练需要把样本切块并行、梯度分段回传,而"渐进式加长"(先用短序列预训练、再逐步拉长到百万级)几乎成了长上下文模型的标配训练配方——先学语言,再学长程结构,两者分开训,效果远好于一步到位。

二、注意力机制的工程化:稀疏化、滑动窗口与 KV Cache 压缩

即便有位置编码,标准注意力仍是 O(n²) 的计算与显存开销——上下文每翻一倍,成本翻四倍,1M Token 的全量注意力对任何硬件都是灾难。工程化必须让注意力"偷懒"。

稀疏注意力是第一条路:只计算部分 token 对之间的注意力。典型方案包括局部窗口注意力(只看相邻 token)、全局 token 锚点(每层保留少量"枢纽"token 与全体交互)、以及基于内容或哈希的稀疏模式(如 Reformer 的 LSH)。稀疏注意力在长文本摘要、代码库理解上效果接近全量注意力,但对需要跨全篇精确关联的任务仍有损耗。

滑动窗口(Sliding Window)是另一条务实路线:每个位置只与前后 W 个 token 交互,配合多层堆叠让信息逐层"接力"传播。它的显存占用与窗口大小线性相关,让超长输入在有限 GPU 上跑起来成为可能;代价是长程信息需要经过多层传导,存在"衰减"风险。

KV Cache 压缩则是推理侧的关键。长上下文推理时,缓存键值张量本身就可能占满显存——1M Token 的 KV Cache 在原始精度下可轻松超过几十 GB,于是出现了 KV 量化(把缓存压到 4-bit 甚至更低精度)、KV 驱逐(按注意力权重或重要性评估丢弃低价值历史 token)、以及基于相似度合并的缓存共享技术。另一个不可或缺的配套是 Prefill 并行:把 1M Token 的输入预填充阶段拆到多卡并行计算,否则仅"读完全文"这一步的延迟就足以让用户体验归零。2026 年,KV Cache 压缩与投机解码、Prefill 并行共同构成"长上下文能跑起来"的底层保障。

三、1M 窗口模型盘点:2M 已出现,格局初定

据昆仑镜 AI 中心模型库(2026-08 验证),主流旗舰的上下文窗口已经全面跨过 1M 门槛:

模型上下文窗口输入/输出价(USD/1M tokens)
Grok 4.202M$1.25/$2.5
GPT-5.6 系列(Sol/Terra/Luna)1.05M$0.1-$5 / $0.6-$30
Gemini 3.6 Flash1.05M$1.5/$7.5
GLM 5.21.05M$0.72/$2.25
MiniMax M31.05M$0.3/$1.2
Kimi K31.05M$20/$100
DeepSeek V4 系列1M$0.14-$0.435 / $0.28-$0.87
Qwen3.7 系列1M$0.03-$1.48 / $0.13-$4.43
Claude Opus 51M$5/$25
Grok 4.5500K$2/$6

几个值得注意的信号:Grok 4.20 以 2M 窗口成为当前公开记录的最大者,且输入价仅 $1.25,说明"更大窗口 + 更低价格"并非不可兼得;DeepSeek V4、GLM 5.2、Qwen3.7、MiniMax M3 四家把 1M 窗口做到了 $0.5 以下的输入价,直接把长上下文从"旗舰特权"变成"普惠能力";而 Kimi K3 用 $20 的输入价换 1.05M 窗口,适合对精度敏感的高价值场景。窗口数字本身正在贬值,真正拉开差距的,是窗口内信息的利用效率。

四、评测方法论:大海捞针之外

长上下文评测长期依赖"大海捞针"(Needle-in-a-Haystack):把一句话埋在超长文本的随机位置,测试模型能否精确召回。它直观、可复现,但局限也明显——它只测"检索",不测"理解"。真实任务中,模型需要的是跨片段推理(A 段的信息 + B 段的信息推出结论)、多跳关联、以及对全文结构的把握,这些恰恰是大海捞针测不出来的。

2026 年的评测趋势是转向复合任务:长文档问答(要求证据定位与引用)、长代码库补全与修复(要求跨文件理解)、多文档摘要(要求去重与权衡)、以及"信息淹没"测试(在大量无关内容中定位少数关键信息,模拟真实噪声环境)。另一个被反复讨论的发现是"位置偏差":同一信息放在开头、中间、末尾,模型的表现可能显著不同——中部位置的召回率普遍弱于首尾,这被戏称为"U 形曲线"。对 Agent 而言,这意味着把关键指令放在提示词首尾、把"仅供参考"的背景材料放中部,能显著提高执行质量——这是少数可以直接落地的评测洞察。评测也不再是单点分数,而是一组刻画"窗口内行为"的曲线:不同长度段的召回曲线、噪声容忍度、跨段推理成功率,共同构成一份"长上下文体检报告"。

五、应用场景与成本权衡:长上下文不是越多越好

1M 窗口打开了三类此前不现实的应用。

整库阅读:把整本技术手册、整份监管文件、整套产品文档一次性塞进上下文,直接问答而不必先切分再检索。RAG 的痛点——切分破坏语义、检索召回不全——在窗口足够大时被部分绕过,催生了"长上下文优先、检索兜底"的新架构。

长代码库:一次载入整个仓库的关键文件,让模型在做跨文件重构、定位 bug 根因时拥有全局视野。相比逐文件喂给模型,1M 窗口让"读完整仓库再动手"成为可能,但这也要求模型在窗口内保持注意力聚焦,否则信息量越大,混淆越严重。

Agent 长期记忆:把数万条历史交互、工具调用记录、业务日志作为上下文持续携带,Agent 可以"记得"数月前的决策背景。这正是长上下文与 Agent 技术栈交汇之处——短期记忆的上限,直接由窗口大小决定。

但成本权衡必须清醒。1M Token 的输入,即使按 $0.3/1M 的平价计算,单次也要约 $0.3,而旗舰模型(如 $20/1M 的 Kimi K3)单次高达 $20;加上 KV Cache 的显存占用与 Prefill 延迟,超长输入在小规模场景下并不划算。长上下文与 RAG 也并非替代关系:RAG 的优势是"按需取用"——把 100 份文档先检索出最相关的 3 份再喂给模型,成本低、噪声小;长上下文的优势是"全局视野"——当问题需要横跨多份文档的隐式关联时,检索可能漏掉的那部分,恰恰是全文阅读能覆盖的。2026 年的主流架构是两者共存:先用检索锁定候选,再用大窗口通读确认,各取所长。工程上的通行做法是分层:日常对话用小窗口低成本模型,只有确需全局视角的任务才升级到大窗口模型;同时用缓存复用、增量续写(只传新增部分)等手段压低实际开销。长上下文是能力,不是默认配置——"用多少带多少"才是 2026 年的工程智慧。

结语

从 128K 到 1M,长上下文走过的是一条"架构创新 + 工程压缩"的双轨路线:位置编码解决外推,稀疏注意力与 KV Cache 压缩解决算力,价格战解决普惠,复合评测解决信任。窗口数字的军备竞赛仍会继续,但下一个真正的分水岭,是模型在百万级窗口里"理解"而非"检索"的能力——那才是上下文工程的下半场。

延伸阅读:昆仑镜(aigc.fushtn.com)作为 AI 数字员工办公平台,其 AI 中心持续收录全球模型的上下文窗口与价格数据,可作为长上下文选型的对照基准。