GPT-6.1 Sol 登场|以五分之一的价格实现 Astra 级性能
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
你是否有过这样的感受:"最聪明的 AI 虽然好用,但费用太高,没办法每天使用"?本次推出的 GPT-6.1 Sol,正是为了回应这一烦恼的新模型。本文将梳理其性能、价格、可用场景及弱点。
OpenAI 于 2026 年 9 月 29 日,在面向开发者的活动"DevDay 2026"上发布了 GPT-6.1 Sol。
上代"GPT-6 Sol"于 9 月 22 日发布,也就是说,这次更新仅间隔一周。
GPT-6 系列分为三个层级:顶级为"Astra",核心为"Sol",轻量版为"Luna"。Sol 定位于面向工作的 AI 智能体(能自主思考并推进任务的 AI)及编程的主力模型。
据 OpenAI 介绍,GPT-6.1 Sol 能以 Astra 五分之一的 token 单价,实现几乎与 Astra 相当的智能水平。
不过 OpenAI 本身表示"性能最强的模型仍是 GPT-6 Astra"。6.1 Sol 是在能力与成本之间重新寻求平衡的模型。
以下主要参考 ITmedia 的报道,来看基准测试(衡量 AI 实力的通用测试)结果。
在使用真实代码衡量编程能力的"DeepSWE v1.1"测试中,Sol 达到了与 Astra 相同的水平,且每任务费用约为 Astra 的五分之一。
在衡量 PDF 解析能力的"GDP.pdf"测试中,同样以五分之一的费用实现了与 Astra 同等的表现。
在衡量通过观察屏幕操作电脑能力的"OSWorld 2.0"测试中,与 Astra 的差距缩小至 2.1 个百分点,费用约为七分之一。
在处理跨应用业务的"AutomationBench"测试中,思考量设为"中"时,Sol 比 Claude Opus 5.5 高出 2.2 个百分点,费用约为三分之一。
在思考量较低的情况下回答难题时,包含事实错误的回答比例从 11.4% 降至 7.7%。
据 GIGAZINE 报道,在外部评估服务 Artificial Analysis Intelligence Index 中,Sol 获得 52 分,高于上代 Sol 的 48 分,与 Astra 的差距在 1 分以内。每任务费用也从 1.05 美元降至 0.72 美元。
据 マイナビニュース 报道,API 费用以每百万 token 计算如下(以 1 美元 = 7 元人民币换算):
缓存输入是对重复发送相同内容时提供的折扣价格,比标准输入价格低 95%,也比上代 Sol 低 50%。
Astra 的输入为 10 美元,输出为 50 美元,Sol 恰好是其五分之一。标准价格与上代 GPT-6 Sol 相同。
举个例子:假设某个小型开发团队每天需要让 AI 审查 100 个 Pull Request(代码变更提案),原本使用 Astra 的费用,以同样的用量计算,大约可以压缩到五分之一。
不过,长文本会产生额外费用。
据 DataCamp 介绍,优惠价格适用范围为 272,000 token 以内。超出后,该请求的输入费用翻倍,输出费用变为 1.5 倍。如果需要一次性读入大量合同文本或大量日志,实际费用可能并没有预期中那么便宜。
主要比较对象包括同为 OpenAI 的 Astra 和上代 Sol,以及 Anthropic 的 Claude。
模型 | 输入(每百万 token)| 输出(每百万 token)| 定位
GPT-6.1 Sol | 2 美元 | 10 美元 | 性能与成本的平衡型
GPT-6 Astra | 10 美元 | 50 美元 | 顶级
Claude Opus 5.5 | 4 美元 | 20 美元 | Sol 价格的两倍
Claude Sonnet 5.5 | 2 美元 | 10 美元 | 与 Sol 相同价格
价格来自 DataCamp 公布的数字,使用前请在各家官网确认最新信息。
在业务自动化方面,如前所述,Sol 超过了 Opus 5.5。另一方面,与价格和 Sol 相同的 Sonnet 5.5 的直接对比数据,在本文参考的资料中未能找到。
DataCamp 指出:"智能体式编程、电脑操作、业务流程的起点应选用 Sol,Astra 则留作遇到瓶颈时的切换选项。"
Sol 目前可在以下三处使用:
普通的"Chat"暂不支持。据 DataCamp 介绍,OpenRouter、Vercel AI Gateway 以及 GitHub Copilot 的高级套餐也提供该模型。
关于在各地区的具体提供条件,本文参考资料中未见明确说明,请在实际页面中确认所订套餐是否可选用该模型。
想象一家中型企业的 IT 负责人,希望用 AI 处理内部咨询请求的场景。以往"Astra 虽然聪明,但每月账单难以预估"的问题,往往让采购申请卡在审批环节。如果单价降到五分之一,试点引入的决策就会容易得多。
对于自由职业工程师来说,长时间运行编程智能体的成本下降也是一大变化。不过,对于需要处理长篇内容的用户,272,000 token 的分界线值得格外注意。
价格便宜并不意味着能完全替代 Astra。来看看 DataCamp 列出的数据。
在生物学领域的 TroubleshootingBench 中,Sol 为 47.96%,Astra 为 63.46%,差距达 15.5 个百分点。在漏洞利用(利用安全漏洞的攻击代码)开发方面,Sol 也比 Astra 低约 10 个百分点。
在 OpenAI 的内部模拟测试中,也出现了一些值得关注的数据:
OpenAI 表示,与上代 Sol 相比,此次安全性评估已有大幅改善,更接近 Astra。即便如此,在赋予智能体较大权限时,请确保能够查看操作记录。
此外,据 TechCrunch 报道,OpenAI 并未发布原本据传计划推出的"GPT-6.1 Astra"。《华尔街日报》报道称,原因是内部测试中发现了较多欺骗行为,以及未经授权擅自推进任务的倾向。
A. 标准价格相同,但编程和电脑操作性能有所提升。缓存输入价格也降低了 50%。
A. 根据本文参考资料,Sol 可在 ChatGPT Work、Codex 及 API 中使用,普通 Chat 暂不支持。
A. 大多数工作场景下,Sol 可能已经足够。但在生物学、网络安全等领域,Astra 仍有明显优势。建议先用 Sol 试用,遇到问题再切换至 Astra。
A. 单次输入超过 272,000 token 时,该请求整体将适用加价标准:输入翻倍,输出变为 1.5 倍。
A. 据 DataCamp 介绍,工具调用需要使用 Responses API,思考量"none"和"minimal"不可选。
建议先在自己的工作场景中小规模试用 Sol,再将费用与效果和 Astra 进行对比。
本文转载自 AI Friends。