让纯文本编码代理(如 DeepSeek 系列)不开多模态也能"看图":一组视觉 CLI 工具外加 agent skill,覆盖图像问答、长截图 OCR、前端 UI 复原与截图驱动的 GUI 自动化——核心理念是"视觉能力不必住在模型里,可以住在 harness 里"。核心能力围绕glance、ground、detect展开。纯文本强模型与多模态强模型之间仍有明显价格与能力差,许多人被迫为偶尔看图付费升级。

| 项目 | 内容 |
|---|---|
| 仓库 | Anionex/agent-vision-toolkit |
| 语言 / 许可证 | Python / MIT |
| 总星标 | ⭐ 1107(截至 2026-08-26) |
| 创建时间 | 2026-08-01 |
| 榜单 | 近30天新星榜 第19名 |
让纯文本编码代理(如 DeepSeek 系列)不开多模态也能"看图":一组视觉 CLI 工具外加 agent skill,覆盖图像问答、长截图 OCR、前端 UI 复原与截图驱动的 GUI 自动化——核心理念是"视觉能力不必住在模型里,可以住在 harness 里"。
纯文本强模型与多模态强模型之间仍有明显价格与能力差,许多人被迫为偶尔看图付费升级。该项目给出优雅中间态:提取请求意图发给外部多模态 API,返回任务感知的描述而非泛泛识图。加上透明本地代理让 Codex/Claude Code 无缝获得图像能力,以及 GUI 自动化 playbook(locate → act → recapture → verify)这样的实战配方,精准命中了"省钱的伪多模态"需求。
Python 3.11+,`pillow` 支撑 ground/detect/crop 与 OCR 流水线,`numpy` 支撑 trace。无缝集成层是一个监听 19100 端口的本地透明代理:把发往你现有纯文本上游的请求截获,将图片替换为由所选视觉 API 生成的文字描述再转发;协议兼容 OpenAI Chat Completions(默认)、Responses 与 Anthropic Messages,由 `VISION_API_PROTOCOL` 切换。另配 Pi/Oh My Pi 与 OpenCode 的原生扩展插件,及 DeepSeek Harness 子模块 `dsh-vision-toolkit`(10 个视觉工具含 grounding、像素 diff、主色分析)。
需一个任意模型的编码代理 + 一个兼容三种协议之一的多模态 API 端点。手动安装:
# ~/.config/agent-vision-toolkit/env(chmod 600)
VISION_API_KEY=sk-...
VISION_BASE_URL=https://openrouter.ai/api/v1
VISION_MODEL=google/gemini-3.6-flash
git clone https://github.com/Anionex/agent-vision-toolkit.git
export PATH="$PWD/agent-vision-toolkit/bin:$PATH"
npx skills add Anionex/agent-vision-toolkit --skill vision-skills -a codex -g --copy -y
也可直接复制 `skills/vision-skills/` 到 `~/.codex/skills/`。
glance screenshot.png -q "What is the dominant color of this image?"
ground screenshot.png "Send button"
long_screenshot_ocr.py long-chat.png --mode chat -o long-chat.ocr.md
trace icon.png -o icon.svg # 本地确定性执行
crop screenshot.png --region 1563,514,1668,621 -o send-button.png
对比直接换用多模态模型,它在效果上有天花板但换来极低的边际成本与自由组合;对比 GPT-4V 式通用视觉助手,它的价值在各 playbook 的工艺沉淀(OCR 合并、UI 复原、确定性 SVG)。与 LongHorizon-Harness(P065)这类 process 层框架互补:那个管恢复循环,这个管感知补件。