💬 观点Google DeepMind
Introducing computer use in Gemini 3.5 Flash — Gemini 3.5 Flash 新增计算机使用能力,可操控桌面应用。
Gemini 3.5 Flash 新增计算机使用能力,可操控桌面应用。
2026-06-24原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
Gemini 3.5 Flash 计算机使用
computer use 从独立模型变为 3.5 Flash 内置工具
- 此前仅为 Gemini 2.5 独立模型
- 现原生集成进主 Flash 模型
- 号称最佳 agentic 表现
⚙️ 流程拆解
STEP 1通过 API 接入 3.5 Flash
STEP 2启用内置 computer use
STEP 3agent 观察屏幕并推理
STEP 4跨端执行操作
STEP 5敏感动作请求确认
🔗 涉及的概念与玩家
- Gemini 3.5 Flash模型
- Gemini 2.5模型
- Google DeepMind公司
- Gemini API产品
- Gemini Enterprise Agent Platform产品
- Browserbase产品
- computer use方法
- prompt injection概念
- Gemini 3.5 Flash—内置→computer use
- Gemini 3.5 Flash—通过接入→Gemini API
- Gemini 3.5 Flash—通过接入→Gemini Enterprise Agent Platform
- Google DeepMind—发布→Gemini 3.5 Flash
- computer use—面临风险→prompt injection
- Browserbase—提供演示→Gemini 3.5 Flash
- 模型能直接控制鼠标和键盘,执行点击、输入等操作,模拟人类与软件交互。这意味着 agent 可自动化传统 GUI 任务,无需 API 支持。
- 通过屏幕截图理解界面,并生成坐标和动作序列,实现跨平台操作。开发者可构建能操作任意桌面应用的通用 agent。
- 该能力在测试中完成网页导航、数据录入等复杂任务,错误率低于同类方案。这为工具链提供了更鲁棒的 GUI 自动化基础。
原文:Introducing computer use in Gemini 3.5 Flash · 作者 Google DeepMind
🕸 顺着图谱继续读
- Gemini Omni 1.1 Flash lets you build with more control — Gemini Omni 1.1 Flash 发布,强调开发者可控性与实时交互能力2026-08-27 · 共同涉及 Google DeepMind、Gemini API、Gemini Enterprise Agent Platform
- Introducing agentic video understanding with Gemini — Gemini 新增智能体视频理解,可实时感知并响应视频中的指令。2026-09-01 · 共同涉及 Google DeepMind、Gemini Enterprise Agent Platform
- Introducing Gemini 3.7 Flash — Google DeepMind 发布 Gemini 3.7 Flash,主打低延2026-08-13 · 共同涉及 Google DeepMind、Gemini API
- Gemini Robotics ER 2: powering robotics with video — 谷歌DeepMind发布Gemini Robotics ER 2,提升机器人视频2026-07-30 · 共同涉及 Google DeepMind、Gemini API