Claude Sonnet 5.5 是 Claude 5.5 家族的第二款模型,定位是 Opus 5.5 的更快、更便宜搭档,面向日常编码与文档处理。定价与 Sonnet 5 一致,输入每百万 token 2 美元、输出 10 美元,官方称生成输出速度提升超过 30%。同一周内,OpenAI 的 GPT-6.1 Sol 也把自己定位成“用五分之一价格逼近 Astra 的智能体能力”。
过去两年,模型发布会的标配是一张跑分表。但 2026 年 9 月这一轮,厂商主动强调的变成了另外几个词:缓存价格、输出速度、单任务成本。Cognition 发布 SWE-2 时,直接把“比 Fable 5.1 便宜约 64%”写进核心信息;微软的 MAI-Transcribe-2 主打的是每小时 0.10 美元的语音转写价格,对标 OpenAI、Google 和 ElevenLabs 的转写业务。
这不是巧合。当头部模型的智能差距收敛到几个百分点以内,剩下能拉开差距的只有两件事:单位成本,和在你的具体任务上的稳定性。
单价是每百万 token 多少钱,但同一个任务,不同模型的耗 token 量可能差好几倍:有的模型一步到位,有的要来回重试三次;有的能直接读结构化数据,有的需要你把材料反复喂进去。真正的成本公式是:单任务成本 = 单价 × 该任务实际消耗 × (1 + 重试率)。
9月的国产阵容同样密集:阿里 Qwen3.8-Max-0902 快照在 9 月 2 日上线,主打代码与 Web 开发;DeepSeek V4.1 Flash 于 9 月 10 日发布,552B MoE 架构,价格 0.07 / 0.28 美元;快手 Kling 4.0 在 9 月 28 日开放限量早期访问,单片段最长 30 秒、支持 4K 与 1080p 10-bit HDR,最多 15 个多模态参考输入,正式版计划 10 月发布;美团 LongCat-2.5 Preview 在 9 月 25 日上线,1.6T 参数 MoE、激活约 48B、100 万 token 上下文,并原生支持图像理解;Moonshot 的 Kimi K2.8 Preview 也在同月亮相。
对国内企业来说,这批模型的实际意义是:同等工作量的推理成本在过去三个月里下降了 50% 到 75%。原本因为太贵而被搁置的场景——比如全量客服对话质检、历史合同结构化、产品图批量处理——现在重新进入了可行区间。