高德 ML 团队推出的"Loop Engineering"框架:不训练模型,而是包装 Claude Code、Codex CLI、OpenCode、DeepSeek Harness 等既有编码代理,让它们能跑完横跨桌面 GUI 与终端的长时程任务——计划、执行、验证、断点恢复直到真正完成。核心能力围绕三角色循环、只信审计、角色异构展开。

| 项目 | 内容 |
|---|---|
| 仓库 | AMAP-ML/LongHorizon-Harness |
| 语言 / 许可证 | Python / MIT |
| 总星标 | ⭐ 1330(截至 2026-08-26) |
| 创建时间 | 2026-08-04 |
| 榜单 | 近30天新星榜 第15名 |
高德 ML 团队推出的"Loop Engineering"框架:不训练模型,而是包装 Claude Code、Codex CLI、OpenCode、DeepSeek Harness 等既有编码代理,让它们能跑完横跨桌面 GUI 与终端的长时程任务——计划、执行、验证、断点恢复直到真正完成。
README 里那句"模型决定一轮能做什么,harness 决定失败后如何恢复"戳中痛点,而它拿出的不是口号是数据:同一骨干下 WeaveBench 通过率 51.8→80.7、OSWorld 2.0 得分 2.8→8.3(3倍)、Terminal-Bench 2.1 提到 77.2% 还省了约 24% token。带 arXiv 论文背书(2608.01964)+ 可复现冻结评测套件,让这个新星项目上线即获得技术圈信任。
核心抽象是轻量 `AgentAdapter`,保留各代理原生循环而非重造解释器;默认最多 30 轮 Manage–Execute–Audit。GUI 检测依赖 npm 分发的插件 `codex-computer-use`(仅 Codex)与 `open-computer-use`(Codex+Claude Code)。配置优先级 CLI 参数 > `./.lh-harness/config.toml` > 默认值;任务文本、run id 与 API key 有意排除出配置文件。
需要 Python ≥3.10、uv(或 pip)、PATH 上至少一个代理 CLI(codex/claude/opencode/dsh)、Node.js ≥20(DeepSeek Harness 要求 ^22.19 或 ≥24)。已在 macOS 测试,Windows 支持存在但未充分验证。
uv tool install lh-harness # 或 pip install lh-harness
lh-harness plugin install open-computer-use # 可选 GUI 插件
lh-harness init # 在项目内生成 ./.lh-harness/config.toml
lh-harness doctor # 只读体检环境
TASK="Inspect the current directory and summarize its files."
lh-harness run --task "${TASK}" --agent codex
# DeepSeek Harness 后端
npm install -g @deepseek-ai/dsh
export DEEPSEEK_API_KEY="sk-..."
lh-harness run --task @task.md --agent deepseek_harness \
--model deepseek-v4-flash --no-dashboard
# Web 工作台(默认 127.0.0.1:8799)
lh-harness web --workspace-root .
同期的 phone-harness(P062)专注"操纵真机"的感知执行层,本项目专注"编排恢复"的过程管理层,两者互补而非竞争;对比 SWE-agent/OpenHands 这类自带 agent 的框架,它是外挂编排层、不绑定任何一家 CLI。论文与冻结评测集是其相对同类 harness 项目最硬的差异化资产。