谷歌把视频理解这件事彻底改写了:以前AI看视频像一帧一帧翻书,现在它学会了"跳着看"。
9月1日,Google DeepMind在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite上正式启用"智能体式视频理解"。传统做法是按固定的每秒1帧速率把整段视频喂进模型,不管你问什么,它都从头到尾一帧帧看。新做法是模型自己决定看哪段、以多快速度看、走画面还是音频还是字幕。
效果有多猛?官方数据:Token消耗最多降88%,成本最多降66%,准确率最多提升7%。同时降成本还升准确率,说明以前绝大部分Token花在了跟问题无关的画面上。
这个功能已经通过Gemini API开放,支持上传视频和YouTube链接,不额外收取功能费。适用场景包括秒级片段定位、长视频检索、异常检测和动作计数。
举个例子:你有一段47分钟的产品发布会视频,问"最重要的三个发布是什么",模型不会傻乎乎地看完全部47分钟,而是快速扫描后聚焦到关键片段,一分钟内给你带时间戳的摘要。以前这种需求要么花钱看完整段视频的Token费用,要么自己写脚本截取片段。
谷歌还说这个能力将很快推送到Gemini应用端,并在未来几个月内为YouTube的"Ask YouTube"功能提供支持。
对做视频审核、安防回溯、赛事集锦、课程检索的团队来说,这等于把长视频AI分析的成本门槛拉低了一个数量级。之前因为太贵而搁置的需求,可能已经进入可做区间了。
你平时会用AI分析长视频吗?最需要什么功能?

