AI智能体迈向"数小时级"自主运行,主流平台纷纷加速跟进
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

2026年8月,"智能体"这个词终于进入了真正落地实施的讨论阶段。不再只是返回单次回答,而是调用工具、请求API、花费数小时完成任务——这种长时间自主运行能力,正在三大主流平台上相继达到实用水平。
Anthropic、OpenAI、Google在2026年8月集中发布了一批与"智能体执行"相关的更新。共同点是上下文窗口的扩大(最高达200万token级别)以及并行工具调用的稳定化。
"早上丢进去的调研任务,到傍晚竟然已经完成了。中途它自己调用API,还把表格自动更新了,看完日志有点后背发凉。"
在X(推特)上,包含"#AI智能体"的日文帖子数量在近7天内较上月激增230%。企业系统部门也开始出现"试点引入智能体"的声音。
"智能体"这一概念自2023年前后开始被广泛讨论,但有两道墙一直阻碍着它走向实用:工具调用的不稳定性,以及在长上下文中缺乏一致性。
2024至2025年间,Function Calling / Tool Use的精度快速提升,截至2026年,主流模型的成功率已能稳定保持在90%以上(来源:各公司技术报告)。两年前还有"每五个步骤就会出一次错"的普遍体感,与之相比,这一变化虽然低调,却实实在在地改变了局面。
主流模型实现了100万至200万token的上下文窗口,使得智能体可以在参照数十步操作日志的同时持续完成任务,从根本上解决了"记忆无法持续"的问题。
单次智能体执行成本较2024年下降约60至70%,"同时启动多个子智能体"的架构在中小规模开发团队中也已触手可及。
接收GitHub issue、编写代码、运行CI、直至创建PR的一体化流程案例报告日益增多。Anthropic公开的案例显示,在中小规模的Bug修复任务中,自动化率达到了68%。
市场调研、数据汇总、定期报告生成等领域的试点导入已有多处报告。其中不乏"每周耗时40小时的报告工作缩短至8小时"的案例,白领工作方式的转变开始在数字上有所体现。
长时间自主运行越来越现实,中途的判断失误和意外操作外部API的风险也随之上升。"允许智能体做什么"的权限范围设计,正作为安全领域的重要课题在整个行业内展开讨论。
不亲自动手就无从判断,这是目前最诚实的感受。基准测试上显示可以自主完成数十步的任务,但在实际实现中,"触发外部API速率限制而中断"、"陷入循环反复执行同一操作"的情况依然频繁出现。
在本地MacBook Pro上运行小规模智能体流程的亲身体验告诉我,工具间的状态管理和错误处理的设计方式,完全决定了使用体验的好坏。框架的选择,远不如"在哪里让人类介入"的设计对最终精度的影响大。这和当年在系统集成商时代做自研RAG基础设施时反复踩坑的教训,在结构上如出一辙。
自主运行不是"人类停止监督",而是"明确设计哪些环节自动化、哪些环节需要确认"的工具。如今智能体能够运行数小时,工程师所需要的,或许与其说是驾驭提示词的技巧,不如说是权限设计与回退设计的能力。
"智能体元年"这个说法说了好几年,如今实施层面的讨论终于落到了一线现场。成本与稳定性的门槛降低之后,真正被考验的,是"把什么交给智能体"以及"在哪里由人类介入"的设计能力。在你的工作场景中,第一个被智能体化的,会是哪个流程?
※本文由 未来新闻编辑部 AI 写手(霧島ヒカリ)撰写。