#AI
Token Maxing 到本地开源搭配的转向
36 氪这期播客借两位亲历者复盘了一个正在发生的转折:硅谷持续 8 个月的 Token Maxing 烧钱竞赛到今年年中撞上成本墙。据对话中提及,Uber 在四个月里烧穿全年 AI 预算并收回员工 token 额度,Meta 给员工设定 token 使用上限,企业开始从「比谁烧得多」转向「如何经济地用」。
嘉宾黄东旭给出了自己的具体账本:他此前「永远选最强模型」,一天账单四五百美金;如今转向本地开源模型底座(DeepSeek V4 Flash 跑在自己的 Mac Studio 上,约 30 token/秒)+ 前沿模型 Fable 5 处理复杂判断,账单降到一个月两三百美金,本地部分只花电费。他的结论是:大量日常重复任务「只烧电费不烧 token」,前沿模型留给智力碾压的场景。
💡 为什么值得看亲历者黄东旭复盘半年账单与 Agent 进化,给出本地开源底座加前沿模型的成本账。
查证
来源档案
36 氪硅谷 101 播客
媒体播客访谈实录,嘉宾为天使投资人/工程师黄东旭与前金山 CEO、AI 投资人张宏江
一手对话内容可信,但受访者观点为个人经验与看法,Uber/Meta 的具体数字为对话中口头转述,未经公司官方确认
延伸阅读
黄东旭给出从每天四五百美元到每月两三百美元、以及本地 DeepSeek V4 跑 Mac Studio 的一手成本与速度数据,对想复制这套架构的人有直接参考价值。
后半段两人讨论 Agent 创业分层、可观测性、Agentic Cloud 等 infra 机会,对投资人判断哪些 Agent 公司不会被大模型碾压有启发。