#AI
Hugging Face 用 RL 训模型画水彩
Hugging Face 研究员 Sergio Paniego 放出一份完整训练记录:用一个写代码的模型,训到会画水彩。整条链路没有扩散模型,也没有任何图像生成组件——模型输出 JavaScript,调用 p5.brush 笔刷库渲染成画,基座是 Qwen3.5-35B-A3B,用 TRL 里的 GRPO 加 LoRA 训练。
关键在奖励设计:「好不好看」没有标准答案,于是拆成两个可打分的信号。奖励函数九成权重分给 HPSv3 人类偏好打分器和一个做成对比较的评委模型,评审标准来自 178 张手工评分的参考图——这池图框住了整个训练目标的上限。成本上很轻:一张 H200 跑 110 步约 34 小时,算力账单百来美元出头,配方、参考集、环境、LoRA 全部开源在 Hub 上。
💡 为什么值得看视觉审美纳入强化学习,110 步成本百美元,开源可复现。
查证
来源档案
CocoLoop 转述 Hugging Face 官方博客
科技媒体对官方博客训练记录的整理转述,并主动复核了 Hugging Face 博客、TRL/OpenEnv 文档与 arXiv 论文
主线事实与官方博客一致且出处可追溯;算力费用为按挂牌价的粗算而非实测,应按估计值看待
延伸阅读
原文给出三组对照实验(judge-led / hps-led / 仅打分器)的步数、奖励区间,能看清成对比较评委是否真的贡献额外信号