Google DeepMind
@GoogleDeepMind
我们今天在最新模型上线智能体式视频理解:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。它在提高准确度的同时,大幅降低视频分析的 token 用量和成本。
过去是固定帧率把整段视频喂进去。现在模型会配合原生视频工具,按目标在画面、音频和转写之间动态搜索和查看片段。在标准视频分析评测上,成本最多可降 66%,token 最多少用 88%,准确度最多提高 7%。
目前可通过 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform 用于上传视频和 YouTube 视频。在 API 里把 processing 设为 "agentic" 即可。该能力很快会进入 Gemini 应用,并在之后支撑 YouTube 的 Ask YouTube。