#AI
微软辩称 Copilot 极少整句复读新闻
微软在与《纽约时报》及图书作者的版权诉讼中提交新法律文档,主张 Copilot 极少复现新闻或书籍中的完整句子,更遑论可替代原文的实质段落。微软称,在证据开示阶段向新闻出版商聘请的专家提供了 **820 万条** Copilot 对话日志,这些日志因其命中新闻原告网站关键词、最可能含原告作品而被特意挑出。
微软声称,分析显示其中仅 **59545 条**与用于训练 AI 模型的新闻内容存在至少 16 个重合词;图书作者一方专家则只在 820 万段对话中找到 24 条含至少 30 个重合词的回复,212 本书中仅 10 本出现匹配。微软据此论证使用版权内容训练 AI 应属合理使用。「偶尔复现文本片段',其结论是 '几乎不削弱 LLM 训练的转化性目的」。
💡 为什么值得看微软 820 万条对话新数据,影响 AI 训练合理使用判例。
查证
来源档案
The Verge
主流科技媒体,高级政策记者 Lauren Feiner 报道法律诉讼进展,基于法庭文档原文
报道引用了微软法庭文档的具体数字与《纽约时报》律师的正式声明,事实呈现可靠;但内核数据均为微软单方面主张,其分析口径未经原告验证
延伸阅读
微软能否靠这些日志数据在早期终结案件,取决于法官对'偶尔复现全文是否仍属合理使用'的认定,这会影响所有同类 AI 版权案走向。