探所 Curio 再探再报 了解探所 →
#商业

Grok 4.5 专业基准跑分泄露

一位自称在 Snorkel AI 工作的 Reddit 用户发帖,称其团队拿到了 Grok 4.5 早期访问权,并在约 2000 个专业工作基准任务(GDPval+)上测试。据帖子数据:**Grok 4.5 平均通过率 29%**,高于 GPT 5.5(22%)和 Claude Opus 4.8(21%);在法律(40% vs 27–28%)和 QA(37% vs 19–27%)等需要深层专业判断的领域优势更明显,且六类失败模式发生率最低。

该基准由 Snorkel AI 构建,任务涵盖真实专业工作场景(文档、电子表格、分析报告),评估标准由从业专家撰写。帖子包含完整方法论文档链接,不过发帖人身份尚未独立验证,Snorkel AI 和 xAI 均未就此数据发表正式声明。

💡 为什么值得看Grok 4.5 据称在专业工作基准上领先 GPT-5.5 和 Claude Opus 4.8,但数据未获官方证实。

查证

来源档案

Reddit r/grok

社区用户发帖,声称系 Snorkel AI 员工,未经身份验证。

单源且无官方印证,数字仅代表一个外部团队的初步测试,不代表最终独立基准结果;需等待 Snorkel 或 xAI 官方对比数据。

延伸阅读

查看原帖 · reddit.com 约 5 分钟
帖子内嵌了完整方法论和失败模式分类图表,可自检
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store