项目详情

Awesome Agent Harness

Agent Harness 工程的系统性地图——367 条资源、9 大能力域、学术 Survey 背书

GitHub 地址 1.7k Stars 双语维护 367 条目 · 9 分类 OpenReview Survey 背书

更新于 2026-09-04

← 返回汇总
项目速览

一句话定位

AI Agent 时代的整车工程手册

模型是引擎,harness 是整车——底盘、仪表、安全带、油箱。这份目录把「怎么把 LLM 装成可靠的 Agent」拆成 9 个能力域:编排、上下文工程、沙箱执行、协议接口、评测、可观测、安全治理、参考实现、必读文献。367 条资源中 333 个是 GitHub 项目,全部指向可运行的东西。背后有 OpenReview 学术 Survey 团队背书,数据管道工程化维护(YAML 单源 → 脚本渲染 → 自动校验)。适合正在把 Agent 从 demo 做成产品的工程师。

项目速览

核心数据

367
总条目
333
GitHub 项目(90.7%)
9
能力域分类
1,707
Stars
100%
项目类目 GitHub 覆盖
17
精选一线工程博客
2026-08-31
最近全量验证
5 个月
2026-03 发布至今

数据来源:GitHub API,采集于 2026-09-04。183 forks、65 open issues、月度级目录更新节奏(最近一次 2026-08-30)。无 license 字段。

概念

Harness 是什么,为什么它突然火了

  • 定义:包裹 LLM 的全部工程装置——工具调用循环、上下文管理、沙箱、审批门、记忆、评测。模型决定上限,harness 决定下限
  • 行业转向:2025-2026 一线厂商集体发文——Anthropic《Managed Agents》《Effective Harnesses》、OpenAI《Harness Engineering》《Unrolling the Codex agent loop》、LangChain《The Anatomy of an Agent Harness》——harness 从「框架选型」升级为独立工程学科
  • 本目录的判断:「你的 Agent 需要的是 harness,不是 framework」(Inngest 语)——可靠性基础设施优先于框架思维
  • 证据:LangChain 实测「仅改进 harness 就能提升 benchmark 表现」——同等模型,harness 工程直接换性能
对比:它和其他 awesome list 的差别
本目录典型 awesome list
收录原则implementation-first,项目优先文章工具混收
维护方式YAML 数据源 + 脚本渲染校验手改 README
知识框架9 能力域分类学随手分组
学术背书OpenReview Survey 团队无
知识框架

九大能力域:harness 工程的解剖学

① 架构与编排(64) 多 Agent 协调、控制平面、 工作流引擎、持久会话 Superpowers · LangGraph · deepagents AutoGen · CrewAI · Claude Squad ② 上下文与工作态(29) 记忆层、知识图谱、上下文压缩、 会话状态持久化 Mem0 · Graphify · claude-mem Headroom · OpenViking · Beads ③ 执行基底与沙箱(27) MicroVM、云沙箱、浏览器自动化、 computer-use 基础设施 Daytona · E2B · CUA · OpenSandbox agent-browser · CubeSandbox ④ 协议与工具接口(42) MCP 生态、A2A、agent 合同、 工具接口契约 MCP tooling · 协议适配层 ⑤ 评测与基准(29) Agent evals、SWE 基准、 轨迹评估、回归测试 评测框架 · 基准套件 · eval 工具 ⑥ 可观测与可靠性(21) 追踪、事件日志、恢复、 生产运维 OpenTelemetry 集成 · 追踪面板 ⑦ 安全治理与护栏(27) 审批门、权限、沙箱策略、 审计、egress 控制 OPA 策略 · 审批流 · 隔离边界 ⑧ 参考实现(89) 可读可抄的完整 harness 源码: 终端 Agent、云 Agent、OS 级运行时 SWE-agent · Crush · mini-swe-agent · Grok Build ⑨ 必读与生态地图(39) 一线工程博客、12 Factor Agents、 Martin Fowler 架构视角 Anthropic ×12 · OpenAI ×10 · LangChain ×6
构建域(编排出物) 保障域(质量与安全) 学习域
工程方法

连 awesome list 本身都是 harness 化维护的

data/projects.yaml→ render_readme.py→ README.md / README_zh.md→ verify_catalog.py→ 验证报告
  • 单一数据源:所有条目进 projects.yaml,README 双语版本从脚本生成——改一处,两语言同步
  • 自动校验:verify_catalog.py 检查目录一致性、链接有效性、计数正确性(头部统计就是脚本算的:367/333/90.7%)
  • 星标快照:badges 用快照值渲染,注明非实时——诚实标注数据新鲜度
  • 分类排序稳定:类目内按 star 降序,新增条目不打乱阅读预期
这个细节值得品

大多数 awesome list 死于维护疲劳:手改 markdown、链接腐烂、双语不同步、计数漂移。这份目录把自己的维护流程也 harness 化了——数据与渲染分离、校验脚本把关、验证日期公开。目录讲 harness 工程,目录本身就是 harness 工程的示范品。

精华内容

Featured Blogs:一线厂商的实战档案

Anthropic(12 篇)

Managed Agents 的脑手解耦、长时运行 harness 状态与恢复、跨产品 containment 架构、auto mode 审批委托、工具接口设计、评测方法论、基础设施噪声对 eval 的影响。

OpenAI(10 篇)

Codex agent loop 拆解、Rust harness 的 prompt-cache 保持、Windows 沙箱的受限 token 方案、App Server 跨客户端共享、Symphony 工单驱动编排、skill evals。

其他一线(LangChain / Cognition / Google / Inngest)

Deep Agents 评测与 harness 提升、Cognition 云 Agent 基础设施全记录、Google 分布式 Agent Executor、框架/运行时/harness 职责边界辨析。


这 17 篇的价值不在「教程」,而在把生产环境的取舍原原本本讲出来:为什么 Codex 要确定性工具排序(prompt cache 命中率)、审批疲劳怎么治理、VM 快照恢复的边界情况——都是烧过真金白银才有的知识。

收录样例

三个域里的代表条目

编排域
  • Superpowers:跨 Agent 技能组合方法论(worktree + TDD + review + 子代理)
  • LangGraph:图式状态机运行时
  • deepagents:长时运行 Agent harness(规划 + 子代理模式)
  • Claude Squad:终端多会话控制平面
沙箱域
  • Daytona:弹性沙箱基础设施(文件/Git/LSP/执行 API)
  • E2B:生产级云执行环境
  • CUA:computer-use 基础设施栈
  • K8s Agent Sandbox:Kubernetes 原生沙箱控制面
参考实现域(89 个)
  • SWE-agent / mini-swe-agent:研究级与极简级两极样本
  • Crush / Qwen Code / Grok Build:终端 coding agent 三种流派
  • mini-coding-agent:rasbt 的最小教学实现
  • Learn Harness Engineering:项目式课程,逐阶段可运行

89 个参考实现覆盖 Rust/Go/Python/TS/JVM/.NET——想读源码学 harness,这个分类就是书单。

学术背书

不是野生 list,是有论文的

  • 配套 Survey:《Agent Harness Engineering: A Survey》已挂 OpenReview,作者团队 20+ 人(学术序列作者署名)
  • CITATION 区块:README 提供标准 BibTeX 引用条目——可直接进论文参考文献
  • 定位重叠:Survey 做学术系统性综述,GitHub 目录做工程实现索引——两者互为镜像
  • 话题正当红:harness engineering 是 2026 年 Agent 领域少数「学术+工业同时认可」的新工程学科
@misc{li2026agentharness,
  title={Agent Harness Engineering:
         A Survey},
  author={Li, Junjie and Xiao, Xi and
    Zhang, Yunbei and ... and
    Reddy, Chandan},
  url={https://openreview.net/pdf?id=eONq7FdiHa},
  year={2026}
}

这也解释了目录的分类学为什么比野生 list 严谨——9 个能力域就是 survey 的章节骨架。

风险与局限

冷静看

潜力评估

打分

维度评分依据
内容价值
harness 工程唯一系统性目录,9 分类学本身就是知识框架
维护工程
YAML 单源 + 渲染校验 + 双语 + 验证日期公开
权威性
学术 Survey 团队背书;但筛选 rubric 未公开、无 license
社区运营
issue 无人处理,单向输出
时效性
月度更新,2026-08-31 刚全量验证

综合 8/10。做 Agent 产品的人书架第一层——不是拿来读完的,是拿来按图索骥的:缺哪块能力,去对应分类里找现成轮子和必读文章。

最终裁决

适合谁用

收藏
  • 正在把 Agent demo 做成产品,需要按能力域找轮子
  • 想系统学 harness engineering——9 分类当课程大纲,17 篇博客当教材
  • 选型对比:89 个参考实现按语言/场景检索
  • 写论文/做调研:Survey + BibTeX 现成
绕开
  • 想要教程手把手教(它是地图不是路径)
  • 期望社区答疑(issue 无响应)
  • 把条目 star 数当实时数据用(快照偏差)

上一个
rust-libp2p
下一个
Pretext
在线体验

Harness 成熟度自检器

用目录的 9 大能力域给你的 Agent 系统做体检:逐项勾选,实时生成成熟度评分、雷达图与短板推荐——缺哪块,去目录哪个分类里补。

进入 Playground →
1 / 13