谷歌为 Gemini 加入视频 Agent,分析成本最高降 66%

谷歌为 Gemini 加入视频 Agent,分析成本最高降 66%
谷歌为 Gemini 加入视频 Agent,分析成本最高降 66%

谷歌为 Gemini API 上线 Agentic Video Understanding,让模型可以自主决定查看视频的哪些片段,以及如何进行检查。

普通模式默认以 1 FPS 固定抽帧,再一次性放入上下文。新模式则会沿时间轴自主定位片段,并根据问题选择画面、音频或转录文本;遇到快速动作时,还能提高帧率重新检查。

谷歌自测称,Gemini 3.7 Flash 开启该能力后,Token 消耗最高下降 88%,分析成本最高下降 66%,准确率相对提升最高约 7%。该能力可定位不到 1 秒的瞬间,也能在数小时视频中寻找特定细节。

技术上,这相当于将开发者过去需要自行搭建的“先定位、再精看”流程整合进 Gemini 内部。目前,Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 均已支持。上传视频和 YouTube 视频都可使用,且不另收功能费。后续该能力还将接入 Gemini App 和 YouTube 的 Ask YouTube。

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容