探所 Curio 再探再报 了解探所 →
#AI

HuggingFace 用本地模型做 PR 实时分类

HuggingFace 工程师 Onur Solmaz 用本地开源模型搭建实时 PR 分类通知系统,替代原本依赖闭源模型的方案,实现零模型 API 成本,仅需支付电费。背景是 Claude Fable 5 下架冲击凸显闭源模型可被「拿走」的风险,促使团队转向本地可运行 AI 栈。Solmaz 作为 OpenClaw 项目维护者,需实时响应 P0 问题,在 NVIDIA DGX Spark(128 GB 统一内存的 GB10 机器)上验证仅用本地模型完成分类。核心方案:将 Gemma-4-26b-a4b 与 Qwen 3.6-35b-a3b 接入 agent 框架 pi,模型接收 PR 标题、正文及截断 diff 后,通过受限只读 shell(reposhell)检查仓库输出分类标签,全程不联网且 sandbox 防 prompt 注入。Solmaz 手工标注 330 行评测集(由 GPT-5.5 与 Opus 4.8 多次打标、人工裁定稳定后)。

💡 为什么值得看本地模型 agent 化应用新样本,对比 Gemma 与 Qwen 真实仓库分类性能,对私有化 AI 管线团队有参考价值

三款模型在 330 行标签评测集上的性能对比

  • **精准率**:Gemma-4-26b-a4b=0.716 / Qwen 3.6-35b-a3b=0.831 / DeepSeek-V4-Flash(参照)=0.938
  • **召回率**:Gemma-4-26b-a4b=0.905 / Qwen 3.6-35b-a3b=0.818 / DeepSeek-V4-Flash(参照)=0.714
  • **F1**:Gemma-4-26b-a4b=0.800 / Qwen 3.6-35b-a3b=0.824 / DeepSeek-V4-Flash(参照)=0.811
  • **误报数**:Gemma-4-26b-a4b=227 / Qwen 3.6-35b-a3b=106 / DeepSeek-V4-Flash(参照)=30
  • **单行耗时**:Gemma-4-26b-a4b=1.4 秒 / Qwen 3.6-35b-a3b=13.5 秒 / DeepSeek-V4-Flash(参照)=144.1 秒
  • **总参数 / 活跃参数**:Gemma-4-26b-a4b=26B / 4B / Qwen 3.6-35b-a3b=35B / 3B / DeepSeek-V4-Flash(参照)=284B / 13B

注:Gemma 和 Qwen 结果为 3 次运行均值±标准差,DeepSeek-V4-Flash 为单次参考跑分。Gemma 在另一次独立探测中并发 32 时达到 700+ tokens/s 聚合输出,表格中数据仅为此评测用到的设定。

查证

来源档案

HuggingFace Blog

HuggingFace 工程师 Onur Solmaz 的博文记录其用本地模型加 agent 框架实现仓库 PR 实时分流。

属一手技术实践报告而非经同行评审的研究,性能数据属自测试验性质,硬件与优化设定对结果有直接影响,但作为工程经验记录基本可信。

延伸阅读

想要完整方案 · huggingface.co 约 12 分钟
博客详述 reposhell 沙箱设计、本地 SQLite 调度逻辑,及选用 agent 框架而非 BERT 分类的工程决策,附系统架构图。
只要性能数据 · huggingface.co
三模型对比、硬件设定和评测集构建方法已给出,可直接跳至「Can local models triage PRs?」段。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store