一个用"端到端自我改进循环"训练出的 35B(激活 3B)MoE 推理模型:自动生成任务、自动发现求解支架、强化学习联合优化三件套,专攻 Agentic 编码与工具调用,MIT 开源。核心能力围绕参数、架构、上下文展开。小团队靠方法学逆袭是开源圈最爱看的故事:Ornith 以 qwen3_5_moe 底座起步,却用自我改进闭环把 Terminal-Bench 2.1 打到 67.8、SWE-bench Verified 79、ClawEval 72.5,

| 项目 | 内容 |
|---|---|
| HF 地址 | https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B |
| 类型 | MoE 多模态语言模型(image-text-to-text,思考型) |
| trendingScore | 404 |
| 许可证 | MIT |
| 榜单 | HuggingFace 热榜第 7 名 |
一个用"端到端自我改进循环"训练出的 35B(激活 3B)MoE 推理模型:自动生成任务、自动发现求解支架、强化学习联合优化三件套,专攻 Agentic 编码与工具调用,MIT 开源。
小团队靠方法学逆袭是开源圈最爱看的故事:Ornith 以 qwen3_5_moe 底座起步,却用自我改进闭环把 Terminal-Bench 2.1 打到 67.8、SWE-bench Verified 79、ClawEval 72.5,自称全面超越同规模 Qwen3.6-35B,DeepSWE 上更是 22 分对 0 分的碾压——方法论叙事 + 硬基准反差引爆讨论。下载量已达 8.3 万次(采集时点),增速在同类中极为陡峭。
运行时要求 transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9。双 80GB GPU 部署示例:
vllm serve ornith-ai/Ornith-1.5-35B-A3B --tensor-parallel-size 2 \
--max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_xml \
--reasoning-parser qwen3
客户端用任意 OpenAI SDK 指向本地 `/v1/chat/completions`:响应中 `reasoning_content` 存思维链、`content` 为最终答案。GGUF 版可 `ollama run hf.co/ornith-ai/...` 直接运行;兼容 OpenClaw、Hermes Agent、OpenCode 等 CLI。采样建议:常规 temperature=0.6/top_p=0.95/top_k=20,复现基准用 temperature=1.0。
A3B 稀疏设计使生成吞吐友好:BF16 全量双 48–80GB 卡最稳;单卡 24–48GB 用户可选 AWQ/GPTQ 4-bit 量化;个人笔记本走 GGUF(Ollama/llama.cpp)做尝鲜评测足够;团队级生产建议 vLLM + 工具调用 parser 开启,长任务 Agent 注意把 max-model-len 按 256K 预算规划 KV cache 显存。
终端自动化编码 Agent(repo 级 bug 修复、测试驱动开发);需要密集工具调用的数字员工流程;256K–1M 超长上下文的代码库审计;本地低成本 Copilot 私有化替代。
对比同底座 Qwen3.6-35B:官方口径全维度领先且 DeepSWE 差距悬殊;对比 Gemma 4-31B、Muse Glimmer-30B 等稠密同级:激活 3B 带来数量级的吞吐优势,agentic 编码亦大幅领先;对比 MiMo/Kimi 小激活系竞品则胜在与 Qwen 生态解析器(qwen3_xml/qwen3)无缝兼容。排名为采集时点快照。
模型页 https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B · 团队博客 ornith.ai / deep-reinforce.com · GGUF 衍生仓检索 hf.co/ornith-ai · OpenCode/OpenClaw 社区集成文档