项目详情

PenguinHarness

Let AI Build AI——LlamaFactory 作者的第二个爆款野心:会自我进化的 Agent 开发平台

GitHub 地址 官网 Apache-2.0 2k Stars / 1.5 个月 TypeScript · 桌面+CLI+SDK DeepSeek 深度调优

更新于 2026-09-05

← 返回汇总
项目速览

一句话定位

让 Agent 造 Agent 的工厂

本地优先的多 Agent 应用开发平台:一句话生成完整可运行的 Agent 应用(示例 RAG 应用只花 $0.02),内置评测-找失分-优化-快照的自进化引擎,让 Agent 给自己发版本。深度调优开源模型(DeepSeek 为主),数据分析准确率对齐 Claude Code 但成本仅 1/70。作者 hiyouga(LlamaFactory 作者)——微调框架顶流作者转战 Agent Harness 赛道。适合想低成本批量造 Agent 应用、且信开源模型的中国开发者。

项目速览

核心数据

2.0k
Stars(1.5 个月)
13+
贡献者
1000+
可接模型
12
内置插件
1/70
对比 Claude Code 成本
$0.02
一句话生成完整 RAG 应用
2026-07-19
创建日期
2026-09-05
最近提交(今日)

数据来源:GitHub API,采集于 2026-09-05。72 open issues;Apache-2.0;Node ≥ 24;桌面 App 三平台签名公证。

信任锚

出身:这不是又一个无名新仓库

  • 作者 hiyouga(郑耀威):LlamaFactory 的作者——国内最流行的开源 LLM 微调框架,星标数万级的 AI 基建顶流
  • 团队作战:PrismShadow AI 团队 + 开源社区,不是单人 weekend project;1.5 个月做到日更节奏 + 三平台签名安装包 + 官网/文档/博客全套
  • AI 辅助开发样本:README 署名「Built with Claude Fable 5」——这个仓库本身就是「AI 造 AI 平台」的第一个成品案例
  • 赛道延续性:从「帮人微调模型」(LlamaFactory)到「帮模型变成产品」(PenguinHarness),作者对开源模型生态的理解是连续的
产品矩阵已经完整
形态说明
桌面 AppmacOS(签名+公证)/ Windows(Authenticode)/ Linux,双击即用免登录
penguin CLI一行安装脚本 / npm / 离线气隙包(带 SHA256 密封校验)
Web 界面penguin web → 127.0.0.1:7364,多会话/Trace/评测中心
SDK@prismshadow/penguin-core,给「造 Agent 的 Agent」用

CLI 与桌面共享 ~/.penguin 数据根,可混用;离线安装连内网气隙机都照顾到了。

三大卖点

README 自己宣称的三板斧

① 成本暴击

极简工具集 + 低层干净接口 → 更少工具调用、更少 token。为 DeepSeek 类开源模型深度调优后:数据分析套件准确率第一,成本是 Claude Code 的 1/70;编码任务与 OpenAI Codex 打平。

② 一句话造 App

「抓取这个文档站,做一个能答 Claude Code 问题的 RAG 专家应用,引用出处」→ 脚手架+代码+运行说明全出来,总计 $0.02(DeepSeek V4 Pro)。

③ 自进化引擎

PenguinHarness Skills:Agent 自己跑基准 → 定位失分点 → 发布版本 N+1。每轮快照、每次请求 Trace 可查——进化过程全程透明。

对照口号理解定位:「LangChain 让你手工搭 Agent——1× 速度;PenguinHarness 让 Agent 造 Agent——100× 速度。」

核心机制

自进化闭环:eval → 失分 → 优化 → N+1

① 跑评测 内置评测中心对 Agent 跑基准套件 ② 定位失分 哪个 skill / 哪类任务 拖了后腿,一目了然 ③ 优化 skill Agent 改写自己的 skill (skill 也能写 skill) ④ 版本 N+1 快照存档,可回滚 下轮继续 循环:每轮都有快照 + 全程 Trace 可观测(不是黑盒进化) continual-learning 与 goal 插件驱动这个循环 goal:给 Agent 一个长期目标,它自己拆任务推进;continual-learning:把历史会话经验沉淀回 skill 定位:这是 skill/提示词层的自改进(快照可回滚、过程可审计),不是模型权重的递归自改——诚实标注很重要
评测与定位 优化与发布 机制注解
插件矩阵

12 个内置插件,三类分工

类别插件干什么
办公生产力data-analysis · use-firecrawl · use-bento-slides数据分析(对齐 Claude Code 的主打项)、网页抓取、幻灯片生成
humanizer · goal · continual-learning去 AI 味、长期目标驱动、持续学习(自进化引擎的驱动器)
软件开发software-development · use-claude-code编码工作流;还能把 Claude Code 当子工具调度
AI 应用开发agent-development · model-development造 Agent 应用、调模型——「AI 造 AI」的工位
skill-porting · agent-tuningskill 迁移与调优(自进化的手术刀)

开放性:Agent 也可以自己写、自己优化 skill——插件目录本身就是自进化的素材库。

模型矩阵

1000+ 模型,中国模型一等公民

模型家族(最新代)渠道
DeepSeek V4官方 + OpenRouter + 硅基流动 + 5 家
Kimi K3Moonshot + 5 家
GLM 5.3Z.AI + 2 家
Qwen 3.8 MaxQwen 两制 + 2 家
Hunyuan 3 / InklingOpenRouter / Fireworks
GPT 5.6 · Gemini 3.7 · Claude 5官方 + OpenRouter
  • 策略清晰:每家只接最新一代——维护成本可控,预设开箱即用
  • OpenAI 协议通吃:任何兼容端点(含本地模型)都能挂,实际不设上限
  • DeepSeek 是第一公民:整套 harness 的 prompt/工具协议围绕开源模型特性调优——这是与 Claude Code 系 harness 最大的气质差异
  • 渠道表里全是国内可达服务:硅基流动、TokenDance、Qwen 两种计费——对中国用户的网络与支付现实做了完整功课
风险与局限

冷静看

潜力评估

打分

维度评分依据
定位与卡位
开源模型亲和 + 自进化叙事,赛道卡位精准
作者与团队
LlamaFactory 作者,AI 基建级执行力背书
成熟度
1.5 个月,基准口径未公开,生态刚起步
成本主张
若复测属实,1/70 是数量级优势
活跃度
日更、release 密集、三平台安装包齐备

综合 8/10。观察名单里的高潜力种子——作者上一次从零做开源(LlamaFactory)做到国内微调框架第一。这次从「微调模型」到「让模型造产品」,是更大的一盘棋。

最终裁决

适合谁,不适合谁

试
  • 信开源模型(DeepSeek 系),对 Claude Code 订阅费敏感
  • 要批量造小型 Agent 应用(文档问答/数据报告/内容流水线)
  • 对「Agent 自进化 + Trace 可审计」的工作流感兴趣
  • LlamaFactory 用户想无缝延续到应用层
缓
  • 要企业级成熟度与长期 SLA(才 1.5 个月)
  • 重度依赖 Claude 生态的既有工作流
  • 把「RSI 自进化」当成权重级自我改进来期待

在线体验

自进化循环模拟器

亲手跑一遍「eval → 找失分 → 优化 → 版本 N+1」:设定学习率与衰减,看 Agent 分数曲线如何爬升、增益如何边际递减、快照逐轮累积——PenguinHarness Skills 循环的直觉版。

进入 Playground →
1 / 12