谷歌昨天提升了 Gemini 3.7 Flash、3.6 Flash 及 3.5 Flash-Lite 的智能视频理解能力。
主要提升了视频分析的准确性,并降低了 token 消耗(最高可降 88%)。
实现手段:将模型的核心推理能力与原生视频工具相结合,能够跨视觉帧、音频和转录文本动态搜索、扫描和检测目标视频片段。使 Gemini 能够主动、目标导向地决定观看内容、速度以及通过何种模态(画面、音频或文字记录)来获取所需的关键时刻与信息。
过去开发者需要手动实现这一过程,而通过智能体视频理解,Gemini 可借助智能体循环机制自动完成——调用内部工具加载视频文件的相关片段,大幅降低开发成本。
链接:blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini

