引言:从卖算力到卖模型再到卖成果

过去十年,云计算的商业叙事是「卖算力」——CPU、GPU、存储,按小时计费;过去三年,叙事升级为「卖模型」——API 按 token 计费;而 2026 年正在发生第三次跃迁:卖「成果」——按任务完成度、Agent 执行结果计费。这三次跃迁的叠加,构成了本文要讨论的 MaaS(Model as a Service,模型即服务)产业全景。

MaaS 不是新名词,却是 2026 年最被低估的商业变革。它表面上只是「模型托管 + API 调用」,实质上是云厂商将 AI 能力基础设施化的战略支点:当模型像水电一样按需供给时,云厂商从「算力房东」变成「智能运营商」,而模型厂商从「卖模型」变成「卖服务」。两者的竞合关系,正在重塑整个 AI 产业链的利润分配。

本文将从四个层面展开:云厂商为何押注 MaaS、定价模式如何演进、成本账本如何构成、三类玩家如何博弈,最后为开发者提供一套可操作的选型框架。文中所引模型价格均来自公开可验证的数据源,市场性数字则明确标注为估算,以免把推断误当事实。

一、MaaS 的本质:云厂商的 AI 战略支点

理解 MaaS,先要看清楚云厂商的三层布局。第一层是算力底座:大规模 GPU 集群、高速互联与调度系统,这是云厂商的护城河;第二层是模型层:自研旗舰模型、开源模型托管、第三方模型代理,构成「模型超市」;第三层是应用层:Agent 开发平台、工作流编排、垂直解决方案。MaaS 恰恰是连接第二层与第三层的关键接口——它让模型以标准 API 的形式被任意应用调用,从而把模型能力变成云上可计量的公共服务。

一个值得注意的动向是「Serverless 推理」的普及。传统 API 调用需要开发者自己管理并发与配额,而 Serverless 推理将冷启动、扩缩容、弹性计费全部封装进平台:开发者不为空闲时间付费,只为实际推理量付费。据公开资料整理,2026 年主流云厂商已普遍提供按毫秒级推理时长计费的 Serverless 推理服务,单位成本相比自建 GPU 集群降低约一个数量级(估算)。这意味着中小团队第一次能以「按用量付费」的方式使用顶级模型,而无需承担 GPU 采购与运维的重资产负担。

开源模型的托管是另一条增长曲线。2026 年,Qwen、GLM、DeepSeek 等开源或半开源模型在云平台上的调用量增长迅猛,托管方提供一键部署、量化加速与合规审计,把「开源自由」与「企业级可用性」缝合起来。对云厂商而言,开源模型既是价格战的弹药,也是对抗头部闭源模型厂商议价权的筹码——多一个可托管的开源模型,就多一分对模型层的定价话语权。

对云厂商而言,MaaS 的战略价值在于把 AI 消耗转化为云消耗。模型的每一次推理调用,都同时消耗算力、存储与网络——MaaS 是拉动云资源消耗的「内容引擎」。这也是为什么云厂商愿意以接近成本甚至低于成本的价格提供模型推理:亏在模型,赚在云上。

二、定价模式的三次跃迁:token、吞吐与成果

MaaS 的定价模式正在经历清晰的三段式演进。

第一阶段是按 token 计费,这是大模型时代确立的行业标准。输入输出分别计价,价格随模型能力分级。它的优点是公平透明、易于比较,缺点是 token 与实际业务价值严重脱节——同一个回答,写诗和写代码消耗的 token 相近,商业价值却天差地别。

第二阶段是按吞吐计费,即按每秒处理的 token 数或推理时长计价,典型形态是 Serverless 推理与预留吞吐。这一阶段解决的是弹性问题:高并发应用按峰值预留、低谷释放,成本与负载曲线贴合。按吞吐计费本质上是把「算力租赁」与「模型调用」打包出售,定价锚点从模型能力转向基础设施性能。

第三阶段是按任务与成果计费,这是 2026 年最激进也最有争议的探索。典型形态包括:按次计费的 Agent 任务(如一次完整的市场调研、一轮客服对话)、按成果计费的订阅制(如按生成的合格线索数、按完成的代码审查数)。据公开资料整理(估算),按任务计费的 API 在 2026 年已占部分平台新增 API 流量的一成到两成,增速显著高于 token 计费。

三次跃迁的底层逻辑是同一个:定价锚点从「资源消耗」向「业务价值」迁移。每一次迁移都意味着 MaaS 平台承担更多风险(任务失败算谁的?成果不合格扣款吗?),也意味着离企业采购决策更近——因为 CFO 能看懂「每条合格线索 0.5 元」,但看不懂「每百万 token 2 美元」。

三、成本结构:GPU 折旧、电力与网络的真实账本

理解 MaaS 定价的底线,必须拆解推理成本。一次模型推理的成本主要由三部分构成:硬件折旧、电力、网络与运维。

硬件折旧是大头。一块旗舰训练/推理 GPU 单价数万美元(估算),按三到五年折旧,再摊到每秒处理的 token 数上,构成推理成本的地板。这也解释了为什么降价空间来自架构而非采购:MoE(混合专家)架构只激活部分参数、KV Cache 压缩减少内存占用、投机解码降低无效计算——这些技术每前进一步,单位 token 成本就下一个台阶。据公开资料整理,2026 年主流旗舰模型的有效推理成本相比 2024 年已下降约一个数量级(估算),且主要来自架构与工程优化而非硬件降价。

电力是第二成本项。GPU 满载功耗数百瓦,数据中心的 PUE(能效比)决定电力利用效率。模型厂商选择在电价低、气候冷的地区建推理集群并非偶然——据公开资料整理,电价差异可使推理成本相差约两到三成(估算)。

网络与运维是第三项:跨区域带宽、内容分发、模型版本管理、安全审计,这些「看不见的成本」在自建场景下往往被低估,恰恰是云厂商规模化的隐藏优势——当推理规模达到一定量级,边际成本下降曲线变得陡峭,这正是云厂商敢于打价格战的底气。

此外,推理集群的利用率是隐性变量:自建集群的平均利用率往往不足五成(估算),而云上共享池可通过多租户调度把利用率提到八成以上(估算)——同样一片 GPU,运营效率不同,单位成本可以相差近一倍。这是规模效应最直接的体现。

四、生态位竞争:云厂商、模型厂商与中间层的攻防

MaaS 生态里有三类玩家,博弈格局耐人寻味。

云厂商手握算力、渠道与客户关系,策略是「平台通吃」:既托管自研模型,也代理第三方模型,用统一 API 绑定开发者。它们的焦虑在于模型层被寡头垄断——如果某家模型厂商形成事实标准,云厂商就会沦为「管道」。

模型厂商的焦虑则相反:它们掌握模型能力这一稀缺资源,却缺乏算力规模与销售渠道。头部模型厂商的选择是向上游整合(自建云)或向下游整合(自己做 Agent 平台),两条路都指向与云厂商的正面竞争。2026 年的现实是:大多数模型厂商选择「多云分发」——同时入驻多家云平台,保持定价权与议价权。

中间层是 2026 年最拥挤的赛道:模型聚合平台、推理路由、网关与成本优化层。它们提供统一 API、自动路由(把请求分发给性价比最高的模型)、缓存与降级策略。中间层的生存逻辑是「模型越多越值钱」——当模型供给过剩、价格战激烈,开发者对「用哪家模型最划算」的决策需求反而爆发。

这场三方博弈的短期结果是:模型层价格快速收敛(价格战),云层通过捆绑销售维持利润(模型亏、云上赚),中间层靠信息差与路由优化赚取服务费。长期来看,真正的护城河不是模型本身,而是「数据飞轮」——谁的平台上沉淀了更多真实调用数据与反馈,谁就能训练出更懂业务场景的模型。

五、开发者选择矩阵:用真实价格数据做决策

对开发者而言,MaaS 时代的核心能力是「按场景选模型」。据 2026-08 验证的公开模型库数据,我们可以构建一张粗略的选择矩阵。

先看价格梯度。旗舰档:GPT-5.6 Sol 输入 $5/百万 token、输出 $30,Kimi K3 输入 $20、输出 $100——这是「最高能力、最高单价」档,适合对质量极度敏感、token 消耗量小的场景。主流档:Claude Opus 5($5/$25)、Qwen3.7 Max($1.48/$4.43)、GLM 5.2($0.72/$2.25)、DeepSeek V4 Pro($0.435/$0.87)——覆盖「质量与成本平衡」的绝大多数生产场景。经济档:Qwen3.7 Flash($0.03/$0.13)、DeepSeek V4 Flash($0.14/$0.28)、GPT-5.6 Luna($0.1/$0.6)——适合海量、低敏、批量处理的场景。上述价格均来自 2026-08 验证的公开模型库数据。

三个决策维度值得注意。其一,能力分与价格并非线性对应:据模型库数据,DeepSeek V4 Pro 中文能力分 95、价格却只有 GPT-5.6 Sol 的约十分之一(估算),说明「性价比之王」真实存在,且往往出自架构效率而非补贴。其二,上下文窗口影响真实成本:长文档场景下,1M 窗口模型可以减少多次调用与检索开销,1.05M 上下文的 Qwen3.7 Max、GLM 5.2 相比 262K 窗口模型在长文档场景的综合成本可能更低(估算)。其三,价格战受益者是应用层:2026 年的典型做法是「混合路由」——简单任务走经济档,复杂推理走旗舰档,由中间层自动分流,整体成本可再降约三到五成(估算)。

六、2026 展望:推理规模化的赢家逻辑

2026 年 AI 产业的主线不是「谁家模型最强」,而是「推理如何规模化」。赢家逻辑有三条。

第一,赢在单位成本曲线。推理成本每下降一个数量级,可用场景就扩大一个数量级——从辅助写作到全自动运营,从千人千面推荐到实时决策系统。谁能把单位 token 成本压到足够低,谁就解锁了下一批场景。

第二,赢在计费模式创新。敢于按成果计费的平台,本质上是在替客户承担模型不确定性,这会换来更高的客户粘性与溢价空间。token 计费是商品逻辑,成果计费是服务逻辑——服务逻辑的利润率更高,也更难被替代。

第三,赢在生态锁定。模型会过时,数据飞轮不会。当开发者的应用、工作流、评测体系都围绕某个平台的 API 构建,迁移成本就构成了真正的护城河。

对开发者而言,MaaS 时代最大的红利是「选择权」:模型供给过剩、价格透明、切换成本低。善用这份选择权——按场景选模型、按负载选计费、按价值选供应商——将是从 2026 年起每个 AI 应用团队的必修课。昆仑镜(aigc.fushtn.com)作为 AI 数字员工办公平台,其 AI 中心提供的全球模型性价比数据,正是这类决策的有用参考。