社区「军械库」系列对 Ornith-1.5-35B-A3B 用自制 imatrix 动态再量化并内置 Sharp 对话模板的 GGUF 发行版,自我定位很明确:本地最快的实用编码员——4-bit 约 22 GB 体量,修真实代码库 bug 的速度与成功率对标 Opus 4.6 medium,多轮对话质量为实测本地模型最佳。llama.cpp 用户最缺「干活快、废话少」的中等体量 coder。

| 项目 | 内容 |
|---|---|
| HuggingFace 地址 | https://huggingface.co/peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF |
| 类型 | Model(GGUF 量化发行版) |
| 热度分 trendingScore | 69(截至 2026-08-26) |
| 许可证 | MIT |
| 榜单 | HuggingFace 热榜 L4 第46名 |
社区「军械库」系列对 Ornith-1.5-35B-A3B 用自制 imatrix 动态再量化并内置 Sharp 对话模板的 GGUF 发行版,自我定位很明确:本地最快的实用编码员——4-bit 约 22 GB 体量,修真实代码库 bug 的速度与成功率对标 Opus 4.6 medium,多轮对话质量为实测本地模型最佳。
llama.cpp 用户最缺「干活快、废话少」的中等体量 coder。README 的数据坦诚又扎实:SWE-bench-Live 25 题修好 12 题(与 Opus 4.6 medium 持平,领先基座 4 题、Sonnet 5 medium 4 题);Claw-Eval 多轮对话 67.2 分胜基座 65.3 与 Nail 60.5;同时明说短板 MMLU-Pro 仅 73.7、「考题不行,干活行」。敢自曝弱点的量化卡反而赢得信任。
继承 Qwen35Moe 系混合 SSM/注意力架构,仅 2 个 KV 头使长上下文缓存开销远低于文件体积直觉;unsloth 动态量化 + 自制 imatrix;Sharp 模板让回答更短省 token(也为此付出约 4.3 分知识题代价);作者验证掉分源于模板而非量化——同一量化换回原模板得分即持平基座。支持中英双语与视觉输入。
标准 llama.cpp / Ollama 直接加载 GGUF;共 9 档:
16GB 卡 → UD-IQ3_XXS(13.2GB);24GB 卡 → IQ4_XS(17.7GB)/Q4_K_XL(22.4GB)
32GB 卡 → Q5_K_XL(26.6GB);48GB 卡 → Q6_K_XL/Q8 参考档
基准主推档为 UD-Q4_K_XL。
按显存对号入座即可;上下文余量优先选 IQ4_XS,追求已测体验选 Q4_K_XL;另有 TielCoder MTP 变体仓库可试多 token 预测加速。
同门 Nail 强于考试(MMLU-Pro 高 10.3)弱于聊天;稠密 Dirk 27B 修复更多但慢约 2.5 倍。要知识广度选 Nail,要吞吐选 Tiel。
README 量化对照表与「哪个给谁用」决策图、assets 目录各榜单截图、基座 ornith-ai/Ornith-1.5-35B-A3B。