Google DeepMind Gemini 3.5 Flash 获得计算机使用能力
Google DeepMind 于 6 月 24 日宣布,在 Gemini 3.5 Flash 模型中增加计算机使用(computer use)功能,使其能够通过视觉感知和操作界面与用户计算机交互。这一能力让 AI agent 可以直接控制屏幕、点击按钮、输入文本,执行跨应用的自动化任务 —— 从数据录入到复杂工作流编排。此举将 Gemini 从「对话模型」升级为「操作型 agent」,与 Anthropic 此前的 Claude Computer Use(3 月)竞争,但在更快速轻量的模型上实现。