#AI
蚂蚁 OmniTable 获 VLDB 工业最佳论文
训练大模型之前,语料要先经过解析、清洗、去重、质量评分、Token 化等环节。规模到 PB 级后,数据工程师面对的是数百张表、不断添加的特征,以及少数几条异常数据就能让整批任务重跑。蚂蚁集团用一套统一宽表系统 OmniTable 来解决这个问题,论文获评 **VLDB 2026 工业赛道最佳论文**。
OmniTable 的核心思路是「逻辑统一、物理分离」:同一数据域在上层呈现为一张逻辑宽表,底层仍按规模、访问方式和引擎拆分;特征从脚本里的临时计算,变成带定义、版本、依赖和血缘的系统资产。论文披露系统已在生产环境管理 **超过 35 PB、3050 亿条以上**训练数据,覆盖 Web、代码、PDF 和 SFT 等数据域。
💡 为什么值得看数据工程侧罕见的工业化落地,提速 5.6 倍。
查证
来源档案
量子位
中文 AI 科技媒体,本篇为蚂蚁集团供稿、量子位获授权转载
内容源自蚂蚁官方供稿并附论文链接,可信度较高;但具体数据数字均为论文口径,未经独立第三方验证
延伸阅读
文中所有数字均来自正式论文,含算子融合、记录级容错、后台治理等完整评测,想核实细节可直接看 PVLDB Vol.19 原文