Agent Harness 的演进与模型需求变化
OpenAI 的 Codex 与 ChatGPT 负责人 Thibault Sottiaux 近期通过推文预告,目前的 Codex 虽然是良好的 harness,但在两三个月后将会显得原始。他进一步判断,下一代模型所需要的 harness 将会比用户的笔记本电脑更多。
与此呼应,Anthropic 在其工程博客中提出了 Managed Agents 的架构方案,明确主张将“脑”(规划决策)与“手”(执行工具)进行解耦,旨在让 Claude 能够自主调度周期更长的任务。这两家头部公司目前的关注点正从单纯的“模型增强”转向如何配置能够匹配下一代模型的 harness。
AI 编码协作范式的调整
针对 AI 生成的大规模代码带来的挑战,GitHub 介绍了一种使用堆叠式 Pull Request(PR)的协作方式。该方案将 AI 编码智能体生成的 1000 行以上的巨型 diff 拆分为 L1 到 L4 四个独立分层,具体涵盖数据、API、接线及 UI。通过这种拆解,每一层可以分配不同的审查者,从而重新定义 AI 编码时代的代码审查工作流。
行业成本与开源趋势
在模型定价与竞争方面,Thibault 确认 GPT-5.6 Luna 降价 80% 是永久性的,且效率增益不会消失。同时,Aaron Levie 指出,近前沿开源权重的密集发布正在改写行业计算,使得模型无法长时间维持在闭源状态。
Agent Harness 的背景与定义
Agent Harness(智能体驾驭层)的概念在 2026 年成为 AI 工程圈的讨论焦点。该概念的催化因素之一是 2026 年 2 月 Mitchell Hashimoto 发表的博客,以及 OpenAI 随后使用 Codex Agent 进行的大规模实验。实验结果显示,虽然 Agent 能写出可运行的代码,但几乎无法通过生产级的代码审查。分析认为,问题不在于模型能力,而在于缺乏一套能够约束、引导和验证 Agent 行为的可靠“运行时基础设施”。
在 2025 年到 2026 年初,企业在部署 AI Agent 时面临无法在企业环境稳定落地的痛点。具体症状包括 Agent 无限循环调用工具、忘记之前的决策以及出现越权操作等问题。
评论区
已通过 0 条 · 审核通过后展示