Agent Harness 工程的系统性地图——367 条资源、9 大能力域、学术 Survey 背书
更新于 2026-09-04
← 返回汇总AI Agent 时代的整车工程手册
模型是引擎,harness 是整车——底盘、仪表、安全带、油箱。这份目录把「怎么把 LLM 装成可靠的 Agent」拆成 9 个能力域:编排、上下文工程、沙箱执行、协议接口、评测、可观测、安全治理、参考实现、必读文献。367 条资源中 333 个是 GitHub 项目,全部指向可运行的东西。背后有 OpenReview 学术 Survey 团队背书,数据管道工程化维护(YAML 单源 → 脚本渲染 → 自动校验)。适合正在把 Agent 从 demo 做成产品的工程师。
数据来源:GitHub API,采集于 2026-09-04。183 forks、65 open issues、月度级目录更新节奏(最近一次 2026-08-30)。无 license 字段。
| 本目录 | 典型 awesome list | |
|---|---|---|
| 收录原则 | implementation-first,项目优先 | 文章工具混收 |
| 维护方式 | YAML 数据源 + 脚本渲染校验 | 手改 README |
| 知识框架 | 9 能力域分类学 | 随手分组 |
| 学术背书 | OpenReview Survey 团队 | 无 |
projects.yaml,README 双语版本从脚本生成——改一处,两语言同步verify_catalog.py 检查目录一致性、链接有效性、计数正确性(头部统计就是脚本算的:367/333/90.7%)大多数 awesome list 死于维护疲劳:手改 markdown、链接腐烂、双语不同步、计数漂移。这份目录把自己的维护流程也 harness 化了——数据与渲染分离、校验脚本把关、验证日期公开。目录讲 harness 工程,目录本身就是 harness 工程的示范品。
Managed Agents 的脑手解耦、长时运行 harness 状态与恢复、跨产品 containment 架构、auto mode 审批委托、工具接口设计、评测方法论、基础设施噪声对 eval 的影响。
Codex agent loop 拆解、Rust harness 的 prompt-cache 保持、Windows 沙箱的受限 token 方案、App Server 跨客户端共享、Symphony 工单驱动编排、skill evals。
Deep Agents 评测与 harness 提升、Cognition 云 Agent 基础设施全记录、Google 分布式 Agent Executor、框架/运行时/harness 职责边界辨析。
这 17 篇的价值不在「教程」,而在把生产环境的取舍原原本本讲出来:为什么 Codex 要确定性工具排序(prompt cache 命中率)、审批疲劳怎么治理、VM 快照恢复的边界情况——都是烧过真金白银才有的知识。
89 个参考实现覆盖 Rust/Go/Python/TS/JVM/.NET——想读源码学 harness,这个分类就是书单。
@misc{li2026agentharness,
title={Agent Harness Engineering:
A Survey},
author={Li, Junjie and Xiao, Xi and
Zhang, Yunbei and ... and
Reddy, Chandan},
url={https://openreview.net/pdf?id=eONq7FdiHa},
year={2026}
}
这也解释了目录的分类学为什么比野生 list 严谨——9 个能力域就是 survey 的章节骨架。
| 维度 | 评分 | 依据 |
|---|---|---|
| 内容价值 | harness 工程唯一系统性目录,9 分类学本身就是知识框架 | |
| 维护工程 | YAML 单源 + 渲染校验 + 双语 + 验证日期公开 | |
| 权威性 | 学术 Survey 团队背书;但筛选 rubric 未公开、无 license | |
| 社区运营 | issue 无人处理,单向输出 | |
| 时效性 | 月度更新,2026-08-31 刚全量验证 |
综合 8/10。做 Agent 产品的人书架第一层——不是拿来读完的,是拿来按图索骥的:缺哪块能力,去对应分类里找现成轮子和必读文章。
用目录的 9 大能力域给你的 Agent 系统做体检:逐项勾选,实时生成成熟度评分、雷达图与短板推荐——缺哪块,去目录哪个分类里补。
进入 Playground →