模型是大脑
理解目标、推理、选择下一步,但不天然拥有长期状态与真实世界权限。
发布于:2026-07-19
以 ChatGPT Agent 到 ChatGPT Work 的演进为例:真正决定智能体能否通宵工作、稳定交付和安全执行的,已经不只是模型,而是模型外部那套运行、约束与纠错系统。
2026 年的 Agent 竞争,正从“谁的模型更聪明”转向“谁能把模型组织成一套可靠系统”。模型负责推理和生成,Harness 负责让它看见环境、调用工具、保留状态、控制权限、发现错误、恢复任务,并在真正产生外部影响之前停下来。
理解目标、推理、选择下一步,但不天然拥有长期状态与真实世界权限。
把工具、记忆、沙箱、审批、重试和任务状态接到模型外面。
定义结果、配置边界、处理例外,并为高影响动作作最终决定。
让机器在清楚的授权范围内连续执行,而不是消灭所有人工介入。
因此,“通宵跑任务”已经在技术上越来越可行,但正确形态不是把所有确认都删掉,而是把低风险、可逆、规则明确的动作预先授权;只有涉及付款、发信、发布、删除、改权限或泄露风险时,才设置真正的人工闸门。
Harness 原意是挽具或线束。在 AIGC 语境里,它不是新的基础模型,而是包在模型外面的运行时与治理层。最小版本只是一个循环:模型提出工具调用,系统执行工具,把结果送回模型,直到模型认为任务完成。
生产级 Harness 则要多解决八类问题:任务如何拆分、上下文如何装载、工具如何暴露、权限如何控制、过程如何持久化、失败如何重试、结果如何验证、全程如何追踪。OpenAI Agents SDK 已把 agent loop、tools、handoff、session、guardrails、human-in-the-loop 和 tracing 作为一组基础能力;微软最新文档也把持久待办、上下文压缩、文件记忆、作用域文件访问、常驻审批和 OpenTelemetry 列为典型 Harness 组件。
| 层 | 解决的问题 | 常见机制 |
|---|---|---|
| 意图层 | 到底要交付什么 | 任务契约、计划、验收标准、预算与截止时间 |
| 上下文层 | 模型此刻该知道什么 | 检索、文件、连接器、记忆、压缩与结构化交接 |
| 执行层 | 怎样对真实环境做事 | 浏览器、终端、代码、API、MCP、专用工具 |
| 控制层 | 什么可以做、做到哪 | 沙箱、最小权限、域名白名单、审批策略、速率限制 |
| 可靠性层 | 中断和出错怎么办 | 检查点、持久状态、超时、重试、回滚、故障恢复 |
| 质量层 | 怎么知道做对了 | 测试、评测器、交叉核验、来源检查、人工验收 |
| 观测层 | 发生过什么 | 日志、trace、成本、延迟、工具调用与决策记录 |
模型能力决定上限,Harness 决定这个上限能否稳定地被调用。
目前行业已经跨过“会调用工具”的演示阶段,进入生产化与组织化阶段。但不同产品差距很大,可以用五级成熟度来判断:
| 阶段 | 能力 | 典型短板 |
|---|---|---|
| L0 对话封装 | 提示词加单轮生成 | 离开聊天框就不能行动 |
| L1 工具循环 | 函数调用、搜索、浏览器或代码执行 | 长任务容易迷路,失败后难恢复 |
| L2 工作流智能体 | 计划、待办、路由、记忆、重试、交付物 | 环境变化和隐含需求仍会击穿流程 |
| L3 生产级 Harness | 沙箱、审批、持久化、trace、评测、恢复 | 成本高,规则和评测需要持续维护 |
| L4 组织级自治 | 后台任务、并行工作区、依赖图、自动派生任务 | 人的注意力、治理和长期一致性成为瓶颈 |
前沿系统已经触及 L4。OpenAI 的 Symphony 实验把工单系统作为控制平面:每个任务有独立工作区,依赖解除后自动启动,崩溃或停滞可以重启,人主要审核结果而不是盯着每一轮对话。OpenAI 另一项内部实践显示,在为 Agent 充分改造的代码库里,三个工程师用约五个月让智能体生成约一百万行代码和 1,500 个 PR;关键并非一句更长的提示词,而是把文档、架构规则、浏览器、日志、测试和评审反馈全部变成 Agent 可读、可执行的反馈回路。
但这并不表示 L4 已经普及。Anthropic 在长时应用开发实验中仍发现:上下文越长,智能体越容易保守、丢失连贯性;规划器、生成器、评测器的分工能改善多小时任务,却增加延迟、Token 和编排复杂度。模型升级后,旧脚手架甚至会成为负担,所以成熟 Harness 的另一项能力是持续删减无效流程,而不是只会叠加 Agent。
2025 年 7 月发布的 ChatGPT Agent,是理解 Harness 的好样本。它把 Deep Research 的多步研究、Operator 的可视化浏览器、文本浏览器、终端、有限网络访问和 Gmail、GitHub 等连接器放进同一个任务循环。用户可以中途引导或打断;涉及外部影响的动作会触发确认,敏感网页场景还有 Watch Mode。
截至 2026 年 7 月,原来的 ChatGPT Agent 已不再作为独立模式提供。OpenAI 把能力重新组织为三种工作面:Chat 负责问答,Work 负责研究和制作文档、表格、演示、报告、Sites 等完整交付物,Codex 负责软件工程;网页端的云浏览器处理受支持的公开网站,桌面端浏览器则能在用户许可下使用本地文件、应用和登录状态。
这个变化不是 Agent 退潮,而是 Harness 产品化:从“给你一个通用代理”变成“根据任务类型选择环境、工具和权限”。云浏览器默认不能接收密码、登录、使用密码管理器或付款;遇到 CAPTCHA、登录和敏感动作就暂停。桌面端能力更强,但凭证仍由用户亲自在浏览器输入,账号与主机权限仍由人管理。
ChatGPT Agent 最重要的遗产,不是一个按钮,而是把浏览、研究、执行、交付、暂停和恢复组合成了一套用户可理解的工作协议。
一个成熟任务不是“提示词进去、答案出来”,而是一条循环管线。每一步都可能回到前面重规划,也可能在权限闸门处暂停后持久化,数小时后从原状态恢复。
解析目标、范围、完成条件、风险等级和资源预算。
形成步骤、依赖、待办和需要人工补充的未知项。
检索文档、历史状态、连接器数据和环境规则。
选择浏览器、API、终端或子任务,并先做权限判断。
在沙箱或授权工作区执行,记录输入、输出与副作用。
把结果写回状态,更新计划、成本、进度与下一步。
运行测试、核对来源、检查格式和验收标准。
失败则换工具、缩小步骤、恢复检查点或升级处理。
只有不可逆或高影响动作需要实时人工决定。
获批后发送、发布、交易、付款、删除或修改权限。
提供成品、关键依据、异常、未决问题与操作记录。
将反馈写回规则、文档、工具、测试集和审批策略。
OpenAI Agents SDK 的人工审批实现正体现了这套思想:工具可声明是否需要审批;任务暂停后把状态序列化,批准或拒绝后从原顶层任务继续;同一运行中还可以把某类决定设为持续批准。审批因此不再等于“每一步都问人”,而是可配置、可持久化的策略。
人的工作没有消失,而是从亲自执行每个步骤,转向设计任务系统和承担最终责任。越成熟的 Harness,越会把人从重复确认里移开,把注意力集中在模型无法自行合法决定的事情上。
给出目标、范围、优先级、截止时间、预算和可验证的成功标准。模糊的“做得更好”需要被翻译成可以验收的结果。
补充组织语境、审美、取舍、历史包袱和不应触碰的红线。模型能读文档,却不能凭空知道团队未写下来的共识。
决定数据能否出域、工具能访问什么、哪些网站可信;密码、双重验证、支付和高权限令牌仍应由人或专门密钥系统控制。
对付款、交易、公开发布、向外部联系人发消息、删除数据、改权限和法律承诺作最终决定。审批的是风险,不是每一个机械步骤。
当目标冲突、事实不足、规则互斥或外部环境变化时,决定牺牲什么、保留什么。Harness 可以发现分歧,但价值判断仍需责任人。
核验关键事实、来源、数字、测试和用户体验。不能只让同一个模型既做题又给自己打满分。
把重复出现的意见写进文档、工具、lint、测试、评测集和审批规则,让下一次无需重新解释。
智能体可以执行决定,却不能成为法律、财务、伦理和组织责任的最终主体。责任边界必须在运行前确定。
假设用户要求:“比较五家供应商,读取内部采购记录,做一份成本表和管理层演示,并起草给首选供应商的议价邮件。”这看似一句话,实际会触发完整 Harness。
| 阶段 | ChatGPT Work / Harness 做什么 | 人做什么 |
|---|---|---|
| 启动 | 提出计划,识别交付物、数据源与缺口 | 确认目标,补充预算上限和不能接受的条款 |
| 研究 | 搜索公开资料,通过连接器读取获准的采购数据 | 授权数据范围,说明内部缩写与历史关系 |
| 制作 | 生成对比表、计算口径、演示和邮件草稿 | 提供品牌偏好与管理层真正关心的权衡 |
| 验证 | 检查公式、来源、矛盾项和缺失字段 | 抽查关键数字,判断商业假设是否合理 |
| 行动 | 准备发送邮件,保存完整任务状态 | 审核收件人、承诺和语气后批准发送 |
| 沉淀 | 保存成品、过程记录和可复用模板 | 把“下次不必再问”的偏好写成规则 |
这就是成熟的人机分工:人不需要盯着它搜索每个网页,也不需要批准每次读文件;但系统不会自行决定公司愿意承担的合同风险,更不应在没有审核的情况下替公司发出承诺。
Harness 显著提升了连续执行能力,却没有消除基础模型的概率性。任务越长,微小错误越可能累积;工具返回异常、网页改版、API 限流、状态过期,都可能让原计划失效。
最大的结构性风险是提示注入。智能体在网页、邮件或文档中看到的文字,既可能是资料,也可能是攻击者写给 Agent 的恶意指令。ChatGPT Agent 发布时采用确认、监控、Watch Mode、终端网络限制和默认关闭记忆等措施,正说明能操作真实世界的 Agent 必须假设外部内容不可信。
第二个风险是“评测幻觉”。自动检查可以覆盖格式、测试和已知规则,却很难完全评价战略、审美、可用性和事实是否遗漏。Anthropic 的长任务实验即使加入独立评测器,仍会漏掉布局、交互与深层功能问题。
第三个风险是复杂度反噬。多 Agent、长记忆和反复评测会带来更高成本、延迟和更多故障面。好的 Harness 不追求最多组件,而追求最小但足够的控制闭环。
最实用的方法不是讨论“要不要人”,而是按影响范围、可逆性和不确定性分级授权。
| 风险等级 | 动作例子 | 建议控制 |
|---|---|---|
| 低风险 | 搜索、读取获准资料、草拟、计算、跑测试 | 预先授权,自动执行;保留日志与预算上限 |
| 中风险 | 修改可回滚文件、创建草稿、内部系统批量更新 | 沙箱执行、自动验证、事后抽检;异常才升级 |
| 高风险 | 外发消息、公开发布、部署、删除、改权限 | 执行前展示差异、对象与影响,单点人工审批 |
| 关键风险 | 付款、交易、法律承诺、医疗决定、核心密钥 | 双人复核、额度控制、强身份验证,必要时由人亲自执行 |
对希望“不要中途一直问”的个人或团队,应该建立常驻规则:允许读取哪些目录和系统,允许使用哪些工具,什么金额或影响范围以内可自动处理,何时必须暂停;再要求任务结束时集中报告所有特殊处理、绕行方案、失败重试和未验证假设。这样既减少打断,也保留责任链。
对于开发团队,最值得投资的不是更复杂的提示词,而是让环境对 Agent 可读:把知识放进版本化文档,把架构边界变成可执行检查,把 UI、日志、指标和 trace 暴露给智能体,把重复反馈写成测试。OpenAI 的 Harness Engineering 实践所证明的,正是环境工程会直接决定 Agent 吞吐量。
事实口径来自 OpenAI 官方 ChatGPT Work、云浏览器、ChatGPT Agent System Card、Agents SDK 与 Harness Engineering 文档,以及 Microsoft Agent Framework 和 Anthropic 的长任务 Harness 研究。相关页面:openai.com/index/chatgpt-agent-system-card/ · help.openai.com/en/articles/20001275 · help.openai.com/en/articles/20001280 · openai.github.io/openai-agents-python/ · openai.com/index/harness-engineering/ · openai.com/index/open-source-codex-orchestration-symphony/ · learn.microsoft.com/en-us/agent-framework/agents/harness · anthropic.com/engineering/harness-design-long-running-apps
Harness 已经从 Agent 的配套代码,成长为 AIGC 产品的核心基础设施。它让模型从回答问题,跨越到操作工具、跨小时工作、生成成品和组织级并行执行。
但未来几年真正稀缺的,不是一个从不找人的 Agent,而是一套知道何时不必找人、何时必须停下,并能把每次人工反馈变成下一次自动化能力的 Harness。