GPT‑5.6 不再沿用“主模型、mini、nano”的命名,而是分成三个长期能力档位:
- Sol:旗舰能力,类似以前的主模型。
- Terra:兼顾能力与成本,类似过去的 mini。
- Luna:面向低成本、高吞吐,类似过去的 nano。
三者并不是上下文缩水版。它们拥有相同的上下文长度、最大输出、知识截止时间和主要工具能力,真正的差别集中在模型能力、价格和吞吐定位上。
核心参数对比
以下为截至 2026 年 8 月 4 日的官方API参数:
| 参数 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna |
|---|---|---|---|
| API模型名 | gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna |
| 定位 | 旗舰能力 | 能力/成本平衡 | 低成本、高吞吐 |
| 输入价格/百万token | $5.00 | $2.00 | $0.20 |
| 缓存输入价格/百万token | $0.50 | $0.20 | $0.02 |
| 输出价格/百万token | $30.00 | $12.00 | $1.20 |
| 上下文窗口 | 1,050,000 token | 1,050,000 token | 1,050,000 token |
| 最大输出 | 128,000 token | 128,000 token | 128,000 token |
| 知识截止时间 | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| 文本输入/输出 | 支持 | 支持 | 支持 |
| 图片输入 | 支持 | 支持 | 支持 |
| 音频、视频输入 | 不支持 | 不支持 | 不支持 |
| 流式输出 | 支持 | 支持 | 支持 |
| Function Calling | 支持 | 支持 | 支持 |
| Structured Outputs | 支持 | 支持 | 支持 |
| Fine-tuning | 不支持 | 不支持 | 不支持 |
| Responses API | 支持 | 支持 | 支持 |
| Chat Completions | 支持 | 支持 | 支持 |
| Batch API | 支持 | 支持 | 支持 |
三者的实际成本差多少?
假设一次任务包含:
- 输入:100,000 token
- 输出:10,000 token
- 输入没有命中缓存
成本如下:
| 模型 | 输入成本 | 输出成本 | 单次总成本 |
|---|---|---|---|
| Sol | $0.50 | $0.30 | $0.80 |
| Terra | $0.20 | $0.12 | $0.32 |
| Luna | $0.02 | $0.012 | $0.032 |
也就是说:
- Terra约为Sol价格的40%,便宜60%。
- Luna约为Terra价格的10%,便宜90%。
- Luna约为Sol价格的4%,便宜96%。
如果每天运行1万次上述任务,理论月成本分别约为:
| 模型 | 每月成本 |
|---|---|
| Sol | $240,000 |
| Terra | $96,000 |
| Luna | $9,600 |
这正是三个档位存在的意义:Sol追求单次成功率,Terra追求综合产出,Luna追求规模化经济性。
需要特别注意:当一次请求的输入超过272K token时,三个模型都会对整个请求采用更高费率——输入价格变为2倍、输出价格变为1.5倍。因此,1.05M上下文是能力上限,不代表把上下文塞满最划算。
Sol:为最困难的问题付费
Sol是GPT‑5.6的旗舰型号。未带后缀的API别名 gpt-5.6 会自动指向 gpt-5.6-sol。
它适合:
- 大型代码库修改与架构重构
- 高价值代码审查
- 长时运行的编程代理
- 深度研究与复杂资料综合
- 财务、法律和科学分析
- 多工具、多步骤工作流
- 复杂网页与桌面操作
- 对正确率和最终完成度要求高的任务
- 高质量前端、网站和演示文稿设计
Sol的优势不只是“知道得更多”,而是在复杂任务中更能持续规划、发现错误、修正方向和完成最终交付。
它的缺点也很明确:输出token价格高达每百万30美元。如果任务本身只是抽取字段、分类或改写一句话,使用Sol通常是浪费。
Terra:最适合成为默认模型
Terra是三者中最均衡的型号。它的输入和输出价格都只有Sol的40%,同时保留1.05M上下文、128K最大输出、图片理解以及完整的工具调用能力。
它适合:
- 企业知识库问答
- 常规代码生成和Bug修复
- 带搜索的研究任务
- 文档、表格和演示文稿处理
- 客服与业务助理
- 工作流自动化
- 中等复杂度的数据分析
- 大多数生产环境中的智能代理
如果没有成熟的模型路由和评测体系,最稳妥的起点不是Sol,而是Terra。先以Terra运行大部分请求,只把失败成本高、推理链长或需要最终审判的任务升级到Sol。
简而言之:Sol是“能力上限”,Terra是“生产默认”。
Luna:便宜,但不是只能做简单分类
Luna的输入价格只有每百万token 0.20美元,输出价格为1.20美元,与Sol相差25倍,但它仍然拥有完整的1.05M上下文和工具能力。
它适合:
- 文本分类与内容标签
- 结构化信息抽取
- 排序、过滤、去重
- 批量摘要
- 查询改写
- 意图识别与请求路由
- 简单代码修改
- 子代理执行明确的小任务
- 大规模文档预处理
- 对话中的快速中间步骤
Luna特别适合多代理系统:让Sol或Terra负责规划、协调和最终判断,让大量Luna实例完成检索、扫描、抽取、验证等边界明确的工作。
但不能只因为Luna便宜就让它承担高风险最终决策。医疗、法律、金融结论、复杂代码合并以及不可逆操作,至少应由Terra或Sol复核。
三者共有的推理参数
GPT‑5.6全系列支持六档推理强度:
none
low
medium
high
xhigh
max
API参数为:
{
"reasoning": {
"effort": "medium"
}
}
建议:
none:纯生成、抽取、格式转换,延迟优先。low:轻量推理、简单工具调用。medium:默认平衡档,适合大多数任务。high:复杂分析、代码和多步骤任务。xhigh:困难研究和质量优先任务。max:最困难、值得投入大量推理成本的任务。
如果省略该参数,默认是 medium。GPT‑5.6官方使用指南
Pro模式并不是第四个模型
GPT‑5.6没有单独的 gpt-5.6-pro 模型名。Pro是一种执行模式,可以与Sol、Terra或Luna以及不同推理强度组合:
{
"model": "gpt-5.6-sol",
"reasoning": {
"effort": "high",
"mode": "pro"
}
}
Pro模式会让系统投入更多模型工作,以提高困难任务的可靠性,但也会增加延迟和计费token。它适合高价值代码审查、复杂优化和深度分析,不适合日常请求。
一个容易被忽略的事实是:Sol + medium + pro、Sol + max 和 Terra + high 是三种不同的成本与质量配置,不能简单认为“所有参数都调到最大”一定最划算。
三者共有的高级能力
GPT‑5.6全系列还支持:
- Programmatic Tool Calling:模型编写轻量JavaScript,协调多个工具并处理工具结果。
- Multi-agent:由一个模型协调多个子代理并汇总结果,目前为Responses API测试功能。
- Persisted Reasoning:跨轮次继续利用已有推理信息。
- 显式Prompt Cache:主动指定可复用的缓存前缀。
- 原始图片尺寸:可按原始尺寸处理图片输入。
- Web Search、File Search、Code Interpreter
- Hosted Shell、Apply Patch、Computer Use
- Skills、MCP和Tool Search
三个型号在“有没有这些功能”方面基本一致,区别主要是“完成同一复杂任务时的可靠性、速度和总成本”。
一个实用的模型路由方案
生产环境可以从下面的配置开始:
Luna
├─ 分类、抽取、改写、路由
├─ 批量预处理
└─ 简单子代理任务
Terra
├─ 默认对话与问答
├─ 常规代码和分析
├─ 搜索、文件及工具工作流
└─ Luna结果的中等强度复核
Sol
├─ 最困难任务
├─ 高风险最终判断
├─ 复杂代码库和长时代理
└─ Terra失败后的升级处理
API调用示例:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-terra",
reasoning={
"effort": "medium",
"context": "all_turns"
},
input="分析这份项目计划,找出五个最可能导致延期的风险。"
)
print(response.output_text)
最终结论
三者的选择可以压缩成一句话:
- 结果价值高、错误代价高:选Sol。
- 不确定选谁、大多数正常业务:选Terra。
- 请求量大、任务明确、成本敏感:选Luna。
真正高效的方案往往不是只选一个模型,而是采用“Luna执行、Terra主力、Sol兜底”的三级路由。这样既能保留GPT‑5.6的能力上限,也能避免让所有请求都承担旗舰模型的成本。