GPT-5.5为何深受工程师青睐|并非最强性能背后的原因与评价维度的转变
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
本文要点
2026年4月23日,OpenAI发布了全新AI模型"GPT-5.5"。该模型专为编程辅助设计,定位为"编程智能体(Coding Agent)"。
事实上,GPT-5.5在所有基准测试(衡量AI性能的测试)中并未夺得最高分。例如,在衡量编程问题解决能力的"SWE-Bench Pro"测试中,GPT-5.5的得分为58.6%,而竞争对手Claude Opus 4.7则以64.3%的成绩更胜一筹。
尽管如此,众多工程师仍对GPT-5.5高度关注。这是为什么呢?
GPT-5.5获得认可的最大原因,在于一种被称为"agentic durability(智能体持续性)"的能力。用中文来解释,就是"能够自主思考并持续运作直至任务完成的能力"。
传统AI在没有人类细致指令的情况下,往往会中途停下来。比如在编写程序的过程中出现错误,它们通常会询问"请问该怎么处理?"
但GPT-5.5不同。遇到错误时,它会自行查找原因、思考修复方案,实际完成修复后再推进下一步工作。也就是说,即使没有人在旁监督,它也能"独立跑完全程"。
来看一组具体数据。GPT-5.5在"Terminal-Bench 2.0"测试中取得了82.7%的分数。该测试衡量的是利用命令行(仅通过文字操作计算机的方式)完成复杂任务的能力,即能否将任务坚持到最后完成。
这一分数相较于以往模型有了大幅提升。例如,在衡量通用计算机操作的"OSWorld-Verified"测试中得分78.7%,在知识型工作任务的"GDPval"测试中得分84.9%。
长期以来,AI领域普遍认为"在基准测试中取得高分"是最重要的事。基准测试是衡量AI性能的标准化测试。
然而,进入2026年,情况发生了变化。工程师们开始更看重"能够实际将工作进行到底的AI",而非"在测试中取得高分的AI"。
有数据印证了这一转变。根据斯坦福大学发布的"AI Index 2026",AI智能体成功完成PC操作任务的概率,在2024年仅为12%,到2026年已上升至66%——仅用两年时间就提升了5倍以上。
这一快速演进使AI的评价标准也随之发生了重大变化。过去重视的是"在单项测试中能拿多高的分",而现在以下三点变得至关重要:
换言之,比起"有多聪明","能否放心交付"变得更加重要。
GPT-5.5的另一大特点是"Token效率"高。Token是AI处理文本时的最小单位,Token数量越多,处理成本越高。
GPT-5.5完成相同任务所需的Token数量,比其他模型少72%。这意味着它能用更短的文本给出精准的回答。
具体而言,GPT-5.5的设计理念是"用更少的Token实现更高的得分"。它能省去多余的说明,专注于必要的工作,从而在控制成本的同时取得出色的成果。
不过,API(通过程序调用AI的接口)的使用费用设定为输入5.00美元、输出30.00美元,是上一代的2倍。即便如此,由于Token效率高,实际每个任务的成本往往低于其他模型。
GPT-5.5的主要竞争对手,是Anthropic公司于2026年4月16日发布的"Claude Opus 4.7"。两者有何差异?
Claude Opus 4.7在SWE-Bench Pro测试中得分64.3%,在SWE-bench Verified中得分87.6%,据称在编程能力上重夺王座。它尤其擅长理解大规模代码库(由大量文件构成的完整程序),以及应对大范围的架构变更。
而GPT-5.5则在工具使用的精准性、文件操作以及具体问题解决方面表现出色。可以说,Claude擅长勾勒宏观蓝图,GPT-5.5则擅长精确执行细节任务。
专家指出,"哪个更优秀取决于具体的工作内容"。当需要把握大型应用程序的整体全局时,选Claude更合适;当需要自动化具体任务时,GPT-5.5更为适用。
在广受程序员欢迎的工具"GitHub Copilot"中,选择GPT-5.5会使费用"乘数"提升至7.5倍,意味着完成同样的工作需要支付通常情况下7.5倍的费用。
因此,企业大规模引入GPT-5.5时,总拥有成本(TCO:Total Cost of Ownership)可能会大幅增加,在成本层面需要审慎考量。
另一方面,考虑到GPT-5.5较高的Token效率,实际每个任务的成本有时会低于其他模型。根据使用场景判断哪种模型最为合适,至关重要。
随着GPT-5.5和Claude Opus 4.7的相继亮相,AI行业的竞争进入了新阶段。专家指出"一个月内局势可能发生重大变化",表明AI开发的速度正在持续加快。
未来,单纯的性能比较将让位于对具体运营场景中效率的评估。也就是说,不能只看"这个AI能在测试中得多少分",而需要判断"它在实际工作中能发挥多大作用"。
此外,2026年AI评价体系也在持续走向多元化。编程领域以SWE-bench为标准,网页操作以BrowserGym为标准,企业环境则以τ-bench为标准——针对不同用途使用不同评价指标已成为新趋势。
这些变化表明,AI正在从"实验室的玩具"进化为"可用于实务的工具"。
GPT-5.5的出现,向AI行业提出了一个问题:"什么才是真正重要的?"不只是聪明,更要能放心交付——这正是新时代所需要的AI。
本文为来自 AI Friends 的转载文章。