HuggingFace 用本地模型做 PR 实时分类
HuggingFace 工程师 Onur Solmaz 用本地开源模型搭建实时 PR 分类通知系统,替代原本依赖闭源模型的方案,实现零模型 API 成本,仅需支付电费。背景是 Claude Fable 5 下架冲击凸显闭源模型可被「拿走」的风险,促使团队转向本地可运行 AI 栈。Solmaz 作为 OpenClaw 项目维护者,需实时响应 P0 问题,在 NVIDIA DGX Spark(128 GB 统一内存的 GB10 机器)上验证仅用本地模型完成分类。核心方案:将 Gemma-4-26b-a4b 与 Qwen 3.6-35b-a3b 接入 agent 框架 pi,模型接收 PR 标题、正文及截断 diff 后,通过受限只读 shell(reposhell)检查仓库输出分类标签,全程不联网且 sandbox 防 prompt 注入。Solmaz 手工标注 330 行评测集(由 GPT-5.5 与 Opus 4.8 多次打标、人工裁定稳定后)。
💡 为什么值得看本地模型 agent 化应用新样本,对比 Gemma 与 Qwen 真实仓库分类性能,对私有化 AI 管线团队有参考价值
三款模型在 330 行标签评测集上的性能对比
- **精准率**:Gemma-4-26b-a4b=0.716 / Qwen 3.6-35b-a3b=0.831 / DeepSeek-V4-Flash(参照)=0.938
- **召回率**:Gemma-4-26b-a4b=0.905 / Qwen 3.6-35b-a3b=0.818 / DeepSeek-V4-Flash(参照)=0.714
- **F1**:Gemma-4-26b-a4b=0.800 / Qwen 3.6-35b-a3b=0.824 / DeepSeek-V4-Flash(参照)=0.811
- **误报数**:Gemma-4-26b-a4b=227 / Qwen 3.6-35b-a3b=106 / DeepSeek-V4-Flash(参照)=30
- **单行耗时**:Gemma-4-26b-a4b=1.4 秒 / Qwen 3.6-35b-a3b=13.5 秒 / DeepSeek-V4-Flash(参照)=144.1 秒
- **总参数 / 活跃参数**:Gemma-4-26b-a4b=26B / 4B / Qwen 3.6-35b-a3b=35B / 3B / DeepSeek-V4-Flash(参照)=284B / 13B
注:Gemma 和 Qwen 结果为 3 次运行均值±标准差,DeepSeek-V4-Flash 为单次参考跑分。Gemma 在另一次独立探测中并发 32 时达到 700+ tokens/s 聚合输出,表格中数据仅为此评测用到的设定。
查证
来源档案
HuggingFace Blog
HuggingFace 工程师 Onur Solmaz 的博文记录其用本地模型加 agent 框架实现仓库 PR 实时分流。
属一手技术实践报告而非经同行评审的研究,性能数据属自测试验性质,硬件与优化设定对结果有直接影响,但作为工程经验记录基本可信。
延伸阅读