#商业
Grok 4.5 专业基准跑分泄露
一位自称在 Snorkel AI 工作的 Reddit 用户发帖,称其团队拿到了 Grok 4.5 早期访问权,并在约 2000 个专业工作基准任务(GDPval+)上测试。据帖子数据:**Grok 4.5 平均通过率 29%**,高于 GPT 5.5(22%)和 Claude Opus 4.8(21%);在法律(40% vs 27–28%)和 QA(37% vs 19–27%)等需要深层专业判断的领域优势更明显,且六类失败模式发生率最低。
该基准由 Snorkel AI 构建,任务涵盖真实专业工作场景(文档、电子表格、分析报告),评估标准由从业专家撰写。帖子包含完整方法论文档链接,不过发帖人身份尚未独立验证,Snorkel AI 和 xAI 均未就此数据发表正式声明。
💡 为什么值得看Grok 4.5 据称在专业工作基准上领先 GPT-5.5 和 Claude Opus 4.8,但数据未获官方证实。
查证
来源档案
Reddit r/grok
社区用户发帖,声称系 Snorkel AI 员工,未经身份验证。
单源且无官方印证,数字仅代表一个外部团队的初步测试,不代表最终独立基准结果;需等待 Snorkel 或 xAI 官方对比数据。
延伸阅读
帖子内嵌了完整方法论和失败模式分类图表,可自检