💬 观点Google DeepMind
Introducing agentic video understanding with Gemini — Gemini 新增智能体视频理解,可实时感知并响应视频中的指令。
Gemini 新增智能体视频理解,可实时感知并响应视频中的指令。
2026-09-01原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
Gemini 智能体视频理解
相比静态逐帧处理,token 降 88%、成本降 66%、准确率升 7%
- 长视频(10 分钟至数小时)收益最明显
- Gemini 3.7 Flash 处于准确率-成本帕累托前沿
⚙️ 流程拆解
STEP 1API 配置设为 agentic
STEP 2模型推理定位目标片段
STEP 3调用内部工具加载片段
STEP 4按需切换帧率与模态
STEP 5输出答案并降低 token
🔗 涉及的概念与玩家
- Gemini模型
- Gemini 3.7 Flash模型
- Gemini 3.6 Flash模型
- Gemini 3.5 Flash-Lite模型
- Google DeepMind公司
- Google AI Studio产品
- Gemini Enterprise Agent Platform产品
- agentic video understanding方法
- Gemini 3.7 Flash—支持→agentic video understanding
- Gemini 3.6 Flash—支持→agentic video understanding
- Gemini 3.5 Flash-Lite—支持→agentic video understanding
- Google DeepMind—开发→Gemini
- Google AI Studio—提供接入→Gemini
- Gemini Enterprise Agent Platform—提供接入→Gemini
- Gemini 的智能体视频理解能力使其能够实时处理视频流,识别其中的物体、动作和事件,并据此执行相应操作。
- 该技术可应用于自动化视频监控、智能助手等场景,为开发者提供构建视频交互应用的新基础。
- 对开发者而言,这意味着需要重新考虑视频数据的处理方式,并探索如何将视频理解集成到现有工具链中。
原文:Introducing agentic video understanding with Gemini · 作者 Google DeepMind
🕸 顺着图谱继续读
- llm-gemini 0.33 — Simon Willison 发布 llm2026-08-13 · 共同涉及 Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite
- Gemini Omni 1.1 Flash lets you build with more control — Gemini Omni 1.1 Flash 发布,强调开发者可控性与实时交互能力2026-08-27 · 共同涉及 Google DeepMind、Google AI Studio、Gemini Enterprise Agent Platform
- Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 — Google DeepMind发布三款新Gemini模型,聚焦速度、成本与安全。2026-07-21 · 共同涉及 Google DeepMind、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite
- Introducing Gemini 3.7 Flash — Google DeepMind 发布 Gemini 3.7 Flash,主打低延2026-08-13 · 共同涉及 Google DeepMind、Gemini 3.7 Flash、Gemini 3.6 Flash