能讓谷歌逆風翻盤的AI,可能不是Gemini

愛範兒
09/03

Google 過去六周發布了三個 Flash 模型,但好像 0 個人在意

在 AI 狂飆突進的這兩年裏,Google 似乎總是扮演着那個「起大跑慢」的角色。

老實說,看到 Gemini 在編程和推理上遲遲拿不出讓人眼前一亮的成績時,沒人不會覺得 OpenAI 和 Anthropic 已經把身位拉開了。

不過,代碼、文本處理,甚至圖像生成這些領域的強大模型都會變得非常出色。這只是時間問題而已。

難的是讓 AI 理解這個世界本身:包括視頻、音頻、運動、三維空間、時間和空間關係,以及事物如何相互變化和相互作用。

Google 在 9 月 1 日發布了主動視頻理解功能,讓 AI 判斷該盯住哪一段畫面,什麼時候倒回去重新看一遍,用什麼樣的方式去看,從而得到更精準的理解。

官方的演示是讓模型數掌聲的次數,這是過去 AI 很難做好的任務,因為傳統方式按固定的每秒 1 幀讀取畫面,瞬間發生的動作很容易被漏掉或者和別的聲音混在一起。而在主動理解模式下,模型能根據需要自動調整處理速度,準確識別並數出每一次鼓掌。

加上 Google 手裏握着 YouTube、Maps 和 Search 這類現實世界的數據入口,它對物理世界的觸達方式其實相當特別。

告別逐幀試探,讓 AI 主動看懂流動的世界

AI 理解視頻的方式沒那麼高端。簡單來說,它們是在看圖說話。

當我們把一段視頻餵給傳統的 AI 模型時,系統會在後台悄悄把視頻切碎,比如按照每秒 1 幀的頻率提取靜態畫面。這種做法在一定程度上解決了計算量過大的問題,但其缺陷也顯而易見。

如果視頻裏出現了一個極其短暫的動作,或者一個在 0.5 秒內閃過的畫面,這種粗暴的採樣方式就會將其完美錯過。

更不用說,當視頻長度延伸到幾個小時,龐大的幀數會瞬間撐爆模型的上下文窗口,讓 AI 陷入記憶錯亂的尷尬境地。

Google 給 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型接入主動視頻理解,思路和此前發布的主動視覺有些相似,都是把模型的推理能力和一套原生工具綁在一起,讓模型自己去調用。

模型會先形成一個循環式的判斷過程,決定接下來要看哪一段、用多快的速度看、依賴畫面還是音頻還是字幕,然後調用內部工具把對應片段取出來精讀。開發者原本也能手動拼出類似的處理邏輯,但需要寫不少膠水代碼,如今這被模型自己接管了。

根據 Google 官方公布的基準測試,啓用主動視頻理解之後,token 消耗最多能降低 88%,分析成本最多降低 66%,同時準確率還能提升最多 7%。

Google 在 LongVideoBench 這類長視頻理解基準上做了對比,結果顯示 Gemini 3.7 Flash 在開啓主動理解後,處於準確率與成本的帕累託前沿,是目前測試模型裏性價比最好的一個。

有開發者用 Gemini 3.7 Flash 的主動視頻理解功能配合 Agora 的對話式 AI 技術,搭建了一套小型演示系統。他們錄製了一段視頻,對着系統提出問題,模型分析視頻片段,數清了手指排列的順序,並提取出帶時間戳的關鍵時刻,整個過程支持實時語音對話。

像字幕組般貼心 像彈幕般陪伴

我敢打賭,你或多或少追過字幕組製作過的劇。那時,白字藍邊、懸浮在片子底部的中英字幕,是我們探索另外一個世界的通道。

字幕組很擅長為國內觀衆提供文化背景解釋。

比如在《生活大爆炸》第四季第二集中,劇中角色提及了斯蒂夫·沃茲尼亞克,他在美國或許是個家喻戶曉的人物,但對國內觀衆來說卻較為陌生,於是中文字幕裏用括號標註出了此人為蘋果公司創始人之一。

@ConcordeSky 在翻譯《偉大的旅程》的一集特輯中,把鏡頭裏所有出現的飛機全部考證清楚型號,在字幕裏做出註釋。

現在,AI 也可以像字幕組般貼心地在你觀看過程中彈出有趣的事實。

可以想象你正在觀看一場節奏極快的 NBA 季後賽或是歐洲盃足球賽。

對於普通觀衆而言,賽場上的戰術配合往往是一眨眼就錯過的模糊畫面,我們只能跟隨着解說員的驚呼去感受比賽的激情。

但是,當啓用了 Gemini 主動視頻理解功能的播放器介入時,觀賽體驗將會發生顛覆性的改變。

在直播或錄播的過程中,AI 會在後台以極高的靈敏度實時分析着場上的局勢、攻防兩端的戰術陣型以及每一個球員的跑位。

當賽場上突然出現一次精妙絕倫的反跑空切,或者是針對防守漏洞的戰術犯規時,螢幕邊緣會自然、剋制地彈出戰術拆解畫面。

動態的戰術路線圖會自動在球員腳下延伸,同時拉出該球員在類似位置的歷史投籃熱力圖和數據對比。如果遇到爭議判罰,AI 甚至會結合當下最新的規則條款給出即時的視覺解釋。

在這項技術的加持下,螢幕前不再只是一個被動接受畫面的觀衆,每個人的身邊都彷彿坐着一位不知疲倦、數據詳實的專業場邊戰術分析師。

如今許多家庭都會安裝智能攝像頭來照看家中的幼兒或寵物,然而現有的攝像頭報警功能常常鬧笑話。一陣風吹動了窗簾,或者是光影發生了微小的變化,手機就會頻繁收到「檢測到畫面異動」的無用推送。

連接了 Gemini 的家庭監控系統將完全不同。得益於其對複雜動態場景的理解能力,AI 能夠輕易過濾掉那些由風吹草動、光影變幻產生的無效運動噪點。它的注意力始終聚焦在具有語義價值的實體上。

當一個牙牙學語的幼兒試圖攀爬客廳裏高處的置物架,或者當家裏的貓咪在角落裏呈現出反常的、長期的蜷縮狀態時,它會向監護人的手機推送一條帶有精準場景語義的預警:寶寶正在嘗試攀爬書櫃,請注意安全或者是貓咪已持續萎靡不振超過兩小時,建議觀察健康狀況。

當 YouTube 擁有了眼睛,視頻消費的下半場

這項能力目前已經能通過 Google AI Studio 和 Gemini Enterprise Agent Platform 裏的 Gemini API 調用,支持上傳視頻和 YouTube 視頻兩種輸入,定價沿用標準的 token 計費,沒有額外收費。

Google 表示,這項能力很快會推送給 Gemini App 裏使用 Flash 和 Flash-Lite 系列模型的所有用戶,未來幾個月還會為 YouTube 的Ask YouTube功能提供支持。

順帶一提,擁有 5 億訂閱者的 YouTuber MrBeast 在即將發布的視頻中,將會介紹 Gemini、Google Health 以及 Fitbit Air 等產品。這是他與 Google 多年合作計劃的一部分,他會在穿越叢林、沙漠和北極地區時藉助 Gemini 輔助工具來識別危險、應對惡劣的天氣條件。

在以往,我們與視頻的交互是單向且線性的。你點開一個兩小時的數碼評測視頻,想要尋找關於某款手機螢幕亮度的真實表現,你只能在進度條上反覆拖拽,或者依賴其他熱心網友在評論區留下的時間戳或課代表式總結。

當Ask YouTube成為標配,用戶與視頻之間的牆被徹底推倒。

你可以在播放頁面隨時敲下你的疑問:主講人在哪個時間段對比了這款手機在陽光下的顯示效果?他們的結論是什麼?或者在一段長達數個多小時的烹飪教學視頻裏直接提問:配料表裏提到的迷迭香是在第幾步放進去的?需要醃製多久?

AI 會在瞬間檢索整部視頻,精準地將進度條定位到那一幀,同時在側邊欄用簡潔流暢的語言為你總結出答案。

互聯網上海量的視頻資源,將在這一刻轉化為可以直接被調用的結構化知識庫。

眼下看,Google 在短時間內是很難回到旗艦模型第一梯隊了,但如果真正決定勝負的是誰能造出理解世界、並且能和世界互動的 AI,那麼這場比賽可能才啱啱開始重新洗牌。

未來的 AI 不僅僅會聽、會說、會畫,更能夠用一雙真正懂溫度、懂邏輯的眼睛,和我們一起凝視這個瞬息萬變的世界。

相關參考🖊️:

https://mp.weixin.qq.com/s/eIWgS38EFHS-YF48GFf98Q

https://mp.weixin.qq.com/s/fILhstpTYGYsNqFapbiHWg

https://x.com/Red1OneX/status/2094862171348021528

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10