# AI 代理的下一个优势是可验证的运行框架

> AI 代理的下一个优势不是更多搜索或更大的单一模型，而是能够复核工具调用、来源、分析和判断过程的可验证运行框架。

Published: 2026-09-16T00:00:00+09:00
Updated: 2026-09-16T00:00:00+09:00
URL: /zh/article/ai-agent-harness-2026

## 先说结论

截至 2026 年 9 月 16 日，现有资料显示，AI 代理的竞争力正在从单纯追求更大的模型，转向可验证的运行框架。关键不只是模型能否给出答案，而是系统能否记录调用了哪些工具、阅读了哪些来源，以及结论如何形成，并支持之后重新检查。

Google 建议对编码代理进行行为评估，检查工具调用、文件修改等中间行为，而不是只比较最终字符串或端到端分数 [s1]。这样做的实际价值是诊断：当模型、提示词或工具发生变化时，团队可以更快找到回归发生在哪个阶段。

## 并行只能解决速度

研究代理可以并行搜索、抓取原文和分析材料。如果没有记录哪些结果被阅读、哪些页面失败、每个分析使用了哪些来源，并行只会制造更快但无法复现的结果。可靠的运行框架需要受控的并行工作器、来源状态、可重放事件和主张与来源之间的连接。

Google 对 AI Agents Challenge 优秀提交的总结提到双向 MCP、异步事件总线、统一的回退验证和分层路由 [s2]。这些模式的重点不是让单个模型更聪明，而是把模型和工具组织成可以运行和维护的系统。

## 评估框架本身也要被验证

另一方面，一篇 arXiv 研究指出，代理评估中的任务生成、模拟和判定可能产生累积误差。该研究报告称，十个热门基准中有七个存在有效性问题，在调查的 55 篇论文中，约 82% 使用了不完整、结构不匹配或缺失的评估者间可靠性指标 [s3]。这些数字只代表该研究的样本，不应被当作整个领域的确定统计。

另一篇综述认为，代理验证必须超越一次输入输出的组件测试，转向包含规划、工具使用、记忆和环境变化的完整轨迹 [s4]。因此，行为测试不能替代事实核查和人工编辑。好的运行框架应扩大自动检查范围，同时把不确定性明确交给人来复核。

## 预测

到 2027 年，主要代理框架很可能会在端到端分数之外，默认提供工具调用断言、执行记录重放和行为回归测试。我给出的概率是 78%。需要观察的信号是，官方 CI 示例和版本说明是否把中间行为检查变成默认功能。

研究代理也可能把来源追踪和验证失败率作为运营指标，而不只是公布搜索数量。我给出的概率是 68%。需要观察产品文档是否展示原文获取率、主张与来源的连接以及人工复核队列。

这些内容是预测，不是已经确认的事实。

## Claims

- Google은 최종 문자열 대신 도구 호출과 파일 수정 같은 중간 행동을 검사하는 행동 단위 평가를 제안한다. (Supported)
- 강한 멀티에이전트 구현 사례에는 양방향 MCP, 비동기 이벤트 버스, 검증된 폴백, 계층형 라우팅이 반복해서 등장한다. (Supported)
- 에이전트 평가의 오류는 과제 생성·시뮬레이션·판정 단계에서 누적될 수 있다. (Supported)
- 에이전트 제품의 지속 가능한 차별점이 모델보다 실행 기록과 출처 구조에 가까워질 수 있다. (Open question)

## Forecasts

- 78% — 주요 에이전트 프레임워크가 행동 회귀 테스트를 기본 제공한다 (2027년 말). Signal: 공식 CI 예제와 릴리스 노트에 tool-call assertion과 trace replay가 기본 기능으로 등장한다.
- 68% — 리서치 에이전트가 provenance와 검증 실패율을 운영 지표로 공개한다 (2027년 말). Signal: 제품 문서가 검색량뿐 아니라 원문 확보율, 주장-출처 연결, 사람 검토 대기열을 보여준다.

## Sources

- [The Anatomy of Harness Engineering: How to Evaluate, Iterate, and Guard AI Coding Agents](https://developers.googleblog.com/the-anatomy-of-harness-engineering-how-to-evaluate-iterate-and-guard-ai-coding-agents/) — Google for Developers Blog, 2026-09-09
- [4 engineering patterns behind the strongest AI Agents Challenge submissions](https://developers.googleblog.com/4-engineering-patterns-behind-the-strongest-ai-agents-challenge-submissions/) — Google for Developers Blog, 2026-09-02
- [Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation](https://arxiv.org/abs/2608.00794) — arXiv, 2026-08-01
- [Beyond Component Testing: Validating Agentic AI Systems](https://arxiv.org/abs/2607.29405) — arXiv, 2026-07-31