探所 Curio 再探再报 了解探所 →
#AI

Google 研究:迁移学习并非越多越好

Google Research 发布一项跨人群基因组预测研究,系统性回答了一个迁移学习的关键问题:**外部大数据是否总是越多越好**。团队用 UK Biobank(UKB)的欧洲队列与 Biobank Japan(BBJ)近 20 万日本样本,在 BMI、血压、血脂、血糖等 8 项临床性状上做消融实验,评估多基因风险评分(PRS)的跨人群可迁移性。

结论反直觉:当目标人群样本很少(如 5000)时,混入欧洲数据确实带来统计增益;但目标样本一旦达到**约 1.5 万**,纯本地模型就开始反超,继续混入外部数据反而限制精度提升。这一拐点随性状而异——跨人群遗传相关性高的「保守」性状(如 BMI)到 25k-40k+ 样本仍受益于外部数据,而 HDL、LDL、血糖这类群体特异性性状更早失去增益。

💡 为什么值得看英日双万人消融揭示跨人群 PRS 训练量拐点,决定目标人群策略。

查证

来源档案

Google Research Blog

Google Research 官方研究博客,一手发布于研究团队

官方一手来源,方法与结论均由团队自述,未经同行评议正式发表,数值可作官方口径引用,但应视为预印本级自述

延伸阅读

PRS-CSx vs 简单模型对比 · research.google 8 分钟
多祖先方法为何需要接近 100k 目标样本才能追平弹性网,直接关系基因组预测工具的选型实践
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store