GPT-5.5震撼登场|1M Token×编程之王全解析
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"AI模型,再次刷新了智能上限"——2026年4月23日,OpenAI发布了继GPT-4.5以来时隔一年的全量重训练模型"GPT-5.5"(内部代号Spud,即马铃薯)。
1M Token(相当于5本小说)的超大上下文、Terminal-Bench 2.0全球最高82.7%、API价格较上一代翻倍——大胆的定价与亮眼的基准测试结果引发热议。
为何此时需要全量重训练?与Claude Opus 4.7和Gemini 3.1 Pro有何不同?对中国用户而言又意味着什么变化?本文将用通俗易懂的语言一一拆解。
首先用3分钟梳理发布内容。
2026年4月23日,OpenAI在官方博客《Introducing GPT-5.5》中正式发布GPT-5.5,并于当日面向ChatGPT的Plus/Pro/Business/Enterprise/Edu套餐用户全面推送。次日4月24日API同步上线,开发者可通过"Responses""Chat Completions"端点调用。
就像"新款手机先在门店展示,次日便开放网络购买"一样的连续发布节奏。
面向消费者与开发者在24小时内同步到位的速度感,是本次发布的一大特色。
GPT-5.4发布后仅1至2个月便推出继任模型,OpenAI的加速步伐令业界各方惊叹。
内部开发代号为"Spud"——英语俚语中对马铃薯的亲切称呼。
这个昵称令人联想到"踏踏实实地培育,精心打磨出扎实内里"的研发理念。
"与其在现成料理上加料,不如把基础食材从头重新培育"——这正是本次开发思路的体现。
GPT-5.1至5.4是在同一基础模型上反复微调的系列,而GPT-5.5则将预训练数据与架构全部推倒重来,这是最大的区别。
自GPT-4.5以来时隔约一年,这份蓄势已久的基础模型重建项目的成果,便是Spud(GPT-5.5)。
除标准版"GPT-5.5"外,承担更深层推理的高阶模型"GPT-5.5 Pro"也于同日发布。
就像"普通超跑与赛道竞技版同步上市"的兄弟产品线。
GPT-5.5 Pro针对长时间智能体任务及需要深度推理的研究场景进行了专项优化。
在ChatGPT中以"GPT-5.5 Thinking"显示,Plus/Pro/Business/Enterprise用户均可选择。
GPT-5.5 Pro仅限Pro/Business/Enterprise高阶套餐,形成差异化定位,为用户根据需求与预算提供了更多选择。
"为什么不在现有模型上微调,而要从零开始重做?"我们从三个角度来看。
预训练(Pre-training)是指让AI大量阅读互联网规模的文本数据,从而习得语言基础能力的环节。
就像"在家做布丁时,从头将鸡蛋、砂糖、牛奶混合加热"一样,基础底座决定了最终成品的质量。
通常的做法是在已有底座模型上反复进行微调(Fine-tuning)。
GPT-5.1至5.4相当于在同一块布丁上浇了不同的酱汁,而GPT-5.5则是用全新配方重新制作了布丁本身。
预训练需要数千张GPU、数月的计算时间以及数十亿元级别的投入,堪称AI开发中规模最大的挑战之一。
据OpenAI介绍,GPT-5.5的预训练语料库、架构以及面向智能体的训练目标均已全面更新。
从一开始就以"模型能自主使用工具、制定计划、完成长时间任务"为目标进行设计。
这种理念就如同"与其让上司对新员工逐步下达指令,不如直接告知目标后放手交办"。
得益于长文上下文的持续保持能力、从模糊失败中恢复的能力以及借助工具验证假设的能力大幅强化,GPT-5.5已能从实现、重构、调试、测试到验证一气呵成。
该模型被定位为OpenAI在2026年重点推进的智能体基础设施的核心模型。
"Spud"是英语圈对马铃薯的随性称呼,是OpenAI开发团队带有玩笑性质的代号。
外表朴实无华,营养价值高,能用于各式料理的万能食材形象,与基础模型的通用性不谋而合,颇具匠心。
这个命名瞄准的是"不起眼却不可或缺的餐桌主角"。
OpenAI过去也曾使用食物相关的代号(据传GPT-6使用的是另一种食材代号,而非"Spud")。
比起华丽的营销名称,这类透露研发团队趣味精神的昵称在业界颇受关注。
"具体强在哪里?"我们从三个要点深入探讨。
GPT-5.5在OpenAI API中首次支持"1M Token(100万Token)"的上下文窗口。换算成中文约为60至70万字,相当于一次性读入5本以上的文库本。
就像"将一本厚重的词典瞬间装入脑中,随即对答如流"一样的能力。
无论是超大代码库(公司内部系统的全部源代码)还是跨越漫长时间的聊天记录,都可以整体输入,并基于全局给出回答。
Codex(ChatGPT的编程功能)也扩展至支持400K Token,工程师的实用性又上了一个台阶。
Terminal-Bench 2.0是衡量AI在真实命令行环境中完成复杂工作流(规划、迭代、工具协同)能力的业界标准基准测试。GPT-5.5以82.7%的正确率创下全球最高纪录。
这种自主性堪比"新人工程师能自行规划复杂的构建任务,边修错边坚持完成"的水平。
在SWE-Bench Verified(GitHub真实Bug修复测试)中同样录得88.7%,超越上一代GPT-5.4的87.6%。
通过Codex完成同样任务所需的Token数,比GPT-5.4减少约40%,效率大幅提升。
更聪明的同时减少了多余输出,是实用层面最大的进化。
OpenAI官方宣布:"基于GPT-5.5构建的智能体,能以更少的指令完成规划制定、上下文收集、工具调用、从模糊状态中恢复以及长期工作流的全程完成。"
就像"不用读厚厚的操作手册,只需告知目标便能自行思考行动的下属"一样的转变。
在GDPval(经济价值任务评估)中达84.9%,在OSWorld(PC操作智能体)中达78.7%,在智能体领域实现独领风骚。
OpenAI特别强调,GPT-5.5在知识型工作、初期阶段的科学研究以及计算机操作方面表现尤为突出。
这是将ChatGPT从"回答问题的工具"进化为"执行任务的伙伴"的重要里程碑式发布。
"和其他家的模型比怎么样?"我们从三个维度来梳理。
第三方基准机构"Artificial Analysis"综合智能指数中,GPT-5.5以60分夺得榜首。排名第二的Claude Opus 4.7与Gemini 3.1 Pro均为57分并列第二,OpenAI以3分之差重返顶端。
就像"三科总分以3分之差险胜两位竞争对手,夺得年级第一"一样的微弱优势。
一年前将榜首拱手相让的OpenAI,凭借GPT-5.5再度登顶综合排行。
不过,单一指标定胜负的时代已然结束,按用途分别选用最适合模型的时代才是当今AI市场的本质。
在SWE-Bench Pro(真实世界GitHub Issue解决)中,Claude Opus 4.7达64.3%,GPT-5.5达58.6%,Anthropic最新模型以5.7个百分点领先。
高难度代码修复任务上,Anthropic最新模型略占优势。
"在专业资格考试上略输同事,但日常工作效率更高"的处境。
另一方面,在ARC-AGI-2(77.1%)和GPQA(94.3%)等抽象推理方面,Google的Gemini 3.1 Pro位居首位。
GPT-5.5=智能体、Claude=编程、Gemini=推理,三模型分工使用正逐渐成为2026年的行业标配。
API价格为每百万Token输入5美元、输出30美元,正好是GPT-5.4(输入2.50美元/输出15美元)的2倍。
"比上一代贵了一倍,但性能与效率也同步提升"——如何评价这一平衡因人而异。
GPT-5.5 Pro更进一步,定价为输入30美元/输出180美元,是标准版的6倍。
不过由于输出Token减少40%,业界分析认为实际成本增幅约为20%左右。
使用最新前沿模型的成本是否合理,取决于业务所能创造的附加价值——这是业界分析人士的普遍看法。
"对用户来说具体有什么变化?"我们从三个角度来看。
ChatGPT Plus/Pro/Business/Enterprise套餐用户从4月23日起可自动访问GPT-5.5。
无需额外付费,无需更改设置,模型选择菜单中将出现"GPT-5.5"与"GPT-5.5 Thinking"选项。
就像"流媒体订阅服务在不变更合约的情况下新增了上线影片"一样的体验。
早期用户评测显示,长文摘要、专业术语翻译以及语气措辞的准确性均较上一代GPT-5.4有所提升。
对于基于API构建SaaS产品或AI助手的企业而言,切换至GPT-5.5需要重新审视成本结构。
输出Token减少40%,因此单价×用量的总额未必大幅攀升,但单次请求的最高成本确实有所增加,这一点值得注意。
类似于"电费涨价,但新款空调更省电"的处境。
初创企业和个人开发者的现实解法,是根据用途分别路由至GPT-5.4/5.5/5.5 Pro的"模型路由"设计。
据业界报道,各大国内外企业也已立即启动对GPT-5.5业务应用的评估工作。
国内外各大LLM持续进化的同时,GPT-5.5的出现使前沿性能差距再度拉开。
"每当本土团队提升完成度,海外势力便又登上更高台阶"的追赶格局依然存在。
不过国产LLM在特定语言专业领域及数据主权方面拥有独特优势。
借助GPT-5.5的1M上下文与前沿性能,同时以本地模型处理敏感信息的混合架构,正逐渐成为企业级用户的主流方案。
某SaaS公司CTO正在评估是否将自家产品AI助手底座从GPT-5.4切换至GPT-5.5。
"由于输出Token减少40%,预计在月度API费用基本持平的情况下单纯提升性能"——相关测算已提交内部会议。
借助1M上下文一次性读入客户的长串咨询记录,客服响应精准度也有望大幅提升。
"在合同价格不变的情况下,仅提升服务质量"的进取型判断。
在AI市场中,每逢新模型发布都能迅速做出迁移判断的企业,正是当下竞争优势的来源。
一位就读于经济学专业的大学生正在用ChatGPT Plus辅助毕业论文的主题研究。
"将5篇各100页以上的英文论文同时输入GPT-5.5,梳理共同点与差异点"——这一尝试取得了显著成效。
得益于1M上下文,论文无需分段即可整体读入,语境混淆的情况大幅减少。
就像"拥有一位把所有参考书都装进脑子里的家教,随时可以提问"一样的便利性。
学术领域的生成式AI应用,从此摆脱了长文上下文的制约,进入了全新阶段——这是一个具有象征意义的案例。
一位负责后端架构设计的工程师,正在内部开发中试运行Codex对GPT-5.5的支持。
"将约50万行的内部Java代码库整体输入,自动生成重构方案和单元测试"——结果显示,与GPT-5.4相比完成时间缩短了约30%。
Terminal-Bench 2.0那82.7%的数字,在实际业务中也能切实感受到其效果。
"像请教前辈工程师做Review一样,向AI咨询架构决策的工作环境"正在成为现实。
在不久的将来,在Codex中自主运行的AI结对编程将成为IT行业的新常态。
A. 截至2026年4月,ChatGPT免费套餐暂不支持。GPT-5.5已向Plus(每月20美元)/Pro/Business/Enterprise/Edu等付费套餐开放。
GPT-5.5 Pro进一步限定于Pro/Business/Enterprise高阶套餐。
就像"新片仅在付费会员区优先上映,热门后才向普通用户开放"的节奏。
此外,通过Codex访问时,Plus/Pro/Business/Enterprise/Edu/Go套餐均可使用(上下文限制为400K Token)。
整体呈现出按预算分层访问的阶梯式结构。
A. 标准版GPT-5.5适合日常问答、文本生成和编程任务;GPT-5.5 Pro则适合复杂推理、长时间研究以及大规模架构决策。
两者API成本相差6倍,将简单任务交给Pro处理,就如同在够用代步车的城市路段开大型卡车——纯属浪费。
"根据情况选用合适工具的工匠思维"至关重要。
在ChatGPT中以"GPT-5.5 Thinking"显示,可手动切换。
建议先用标准版GPT-5.5试用,仅在遇到复杂场景时再切换至Pro版本。
A. OpenAI未公布中文专项基准数据,但早期用户评测中,长文摘要、专业术语误译减少以及语气措辞改善方面的正面反馈较多。
得益于1M上下文,中文长文可无需分段直接处理,这在实用层面是一大进步。
"向着输出与英文一样自然的中文模型又迈进了一步"的感受。
不过对于行业及企业专属术语,在未经微调的情况下,处理能力依然存在局限——这一点与以往相同。
在精准度要求较高的业务场景中,结合人工审核的设计依然不可或缺。
A. OpenAI宣布"推理时的知识一致性得到提升",但第三方验证显示幻觉现象依然频发。
基准测试高分与现实中细微事实错误并存,是当代大语言模型的普遍挑战。
就像"考试满分,但日常对话会叫错人名的老师"一样的结构性困境。
在重要决策或正式文件中,AI的输出必须经过人工核实,这一运营原则不容改变。
在可靠性要求较高的业务场景中,结合多模型对比或引用来源验证工具的综合使用,是2026年当前的最佳实践。
A. OpenAI尚未官方宣布,但截至2026年4月,业界已有传言称"GPT-6(代号Spud2等)"的预训练已完成。
业界分析人士预测,距GPT-5.5发布约半年至一年后正式公开的可能性较大。
就像"新机型刚发布,下下代机型的传言便已开始流传"一样的超前信息。
不过GPT-5.5本身的迭代优化(5.5.1、5.5.2等)预计也将同步持续进行。
用户在决定何时追赶最新版本时,不妨将自身的业务周期作为判断依据,这才是务实之选。
"从基础模型重头训练"是一项大规模重训练决策,AI开发的成本、时间与风险均达到最大级别。OpenAI继GPT-4.5之后时隔一年再度做出这一选择,背后是从底层重新构建面向智能体时代新架构的迫切需要。
1M Token的超大上下文、Terminal-Bench全球纪录、输出Token减少40%——这些成就都不是单点功能的叠加,而是从基础设计理念彻底重审后才得以实现的成果。
API价格翻倍的强势定价,也是一场关于社会如何衡量智能价值的实验。
"使用GPT-5.5的一方,能否创造出翻倍的附加价值"——这将是2026年下半年AI应用的主战场。对于每一位用户、企业和开发者而言,战略性地设计"何时、何处、在多大程度上使用"最新前沿模型的能力,正是决定AI竞争胜负的关键时代——从这个角度来看,这次发布的分量便不言而喻。
本文转载自 AI Friends。