#AI
Google 研究:迁移学习并非越多越好
Google Research 发布一项跨人群基因组预测研究,系统性回答了一个迁移学习的关键问题:**外部大数据是否总是越多越好**。团队用 UK Biobank(UKB)的欧洲队列与 Biobank Japan(BBJ)近 20 万日本样本,在 BMI、血压、血脂、血糖等 8 项临床性状上做消融实验,评估多基因风险评分(PRS)的跨人群可迁移性。
结论反直觉:当目标人群样本很少(如 5000)时,混入欧洲数据确实带来统计增益;但目标样本一旦达到**约 1.5 万**,纯本地模型就开始反超,继续混入外部数据反而限制精度提升。这一拐点随性状而异——跨人群遗传相关性高的「保守」性状(如 BMI)到 25k-40k+ 样本仍受益于外部数据,而 HDL、LDL、血糖这类群体特异性性状更早失去增益。
💡 为什么值得看英日双万人消融揭示跨人群 PRS 训练量拐点,决定目标人群策略。
查证
来源档案
Google Research Blog
Google Research 官方研究博客,一手发布于研究团队
官方一手来源,方法与结论均由团队自述,未经同行评议正式发表,数值可作官方口径引用,但应视为预印本级自述
延伸阅读
多祖先方法为何需要接近 100k 目标样本才能追平弹性网,直接关系基因组预测工具的选型实践