Claude 5.1剛問世,另一邊OpenAI Astra馬上殺到。
現在,就連谷歌也有了新動作。最新爆料,Gemini 3.8 Flash將在明日登場。
看來,AI圈又要「過年了」。
Gemini 3.5 Pro取消 下一個大版本4.0
比起Gemini 3.8 Flash的發布,許多人還是更加好奇:Gemini 3.5 Pro到底什麼時候來啊?!
對不起,不用等了,谷歌已放棄......
今年5月I/O大會預告至今,已過去近4個月,Gemini 3.5 Pro進化程度連Flash都比不上。
谷歌也是迫不得已,直接「棄子」。
好在,Gemini 4.0在預訓練中評估優秀,後訓練還在順利進行中。
這篇來自WSJ的獨家爆料,還重磅預告了Gemini 3.8 Flash(代號「Skimaki」)強悍的編程實力。
據稱,在谷歌內部編碼工具Jetski的對比測試中,3.8 Flash直接碾壓Opus模型。
而且,這款模型已研發數月,早在谷歌領導層「大地震」之前就開始了。
Hassabis讓位,首席科學家Jeff Dean離職,讓許多人對Gemini的未來都捏了把汗。
不過,目前看來,一切都在內部有條不紊地進行中。
目前,谷歌計劃先推出Gemini 3.8 Flash,是因為這款模型參數小,所需計算少,更容易出成果。
聽內部人士說,從今年初開始,谷歌就投入了更多的人力和算力,專門用來提升Gemini的寫代碼能力。
特別是,加大了對「強化學習」的投入,讓AI通過不斷試錯來真正學會新本領。
而且谷歌DeepMind和其他實驗室,同時推進多個項目,這樣一來即便是這個不行,另一個還能頂上。
Gemini 3.5 Pro不及預期,但Gemini 4.0還未「出爐」。
如今,硅谷「御兩家」OpenAI和Anthropic,已在前沿模型和編程Agent上,非常能打。
Information稱,OpenAI下一代Astra還採用了一種「循環深度」(recurrent depth)新型推理方法,讓思考token減少的同時,還大幅提升了性能。
這張王牌,即將在本周揭曉。
而此時此刻,谷歌總得交出點東西纔行。
畢竟劈柴承諾之後幾個月,除了發布了一款3.7 Flash,再沒有扔出能讓AI圈興奮的模型了。
或許就在今晚,Gemini 3.8 Flash要登場了。
Gemini第一次,會自己看視頻了
在此發布之前,谷歌今天先來了一波預熱,為Gemini植入了一項新能力——
智能體視頻理解(Agentic Vedio Understanding)
這項功能,簡直上大分。
上傳一段I/O大會視頻,同一款模型Gemini 3.7 Flash,Token消耗直接暴降88%。
谷歌在官博中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite三個模型都能用agentic視頻理解能力,入口在Google AI Studio和Gemini Enterprise Agent Platform。
在標準視頻分析基準上打開這個開關,token消耗最多降88%,分析成本最多降66%,準確率反過來還漲了最多7%。
而且不額外收一分錢,走的仍是標準API的token定價。省錢和變準通常要打架。這次沒打起來。
因為,Gemini學會了「拖進度條」。
過去的處理方式叫「靜態」處理,模型被動接收固定幀率的畫面流,幀率由API參數定死,模型沒有話語權。
現在換成模型自己拿主意,看哪一段、以多快的速度看、是看畫面、聽音頻還是直接讀轉錄文字,都可以自己決定。
這不是谷歌第一次這麼幹。
此前的agentic vision把代碼執行和Gemini原生的圖像理解拼在一起,模型對着一張圖能自己寫代碼去放大、裁剪、比對。
這回輪到視頻,思路照搬,只不過把工具換成了原生視頻工具。
四件以前很難乾的活
官方博客中還列出了幾種高難度的應用場景。
亞秒級片段檢索。以前模型「看」視頻,一秒只截一張圖。問題是,很多東西不到一秒就閃過去了。
現在能精確到不到一秒去定位這些瞬間了。
這意味着「自動剪輯」這件事第一次真正可行了:以前剪輯師得自己趴在時間軸上,一幀一幀地找該在哪裏下刀,現在可以先讓模型掃一遍,把候選的切點標出來,人再去挑。
長視頻裏撈針。幾小時的素材裏問一個複雜問題,不用把幾百萬 token 全燒一遍。
異常檢測。模型盯上某個時間窗口之後,可以專門對這一段提高幀率重新採樣,看清快速運動和細微的畫面瑕疵。產線質檢和安防監控最喫這一口,因為異常本來就只發生在那幾秒裏。
數數。一個動作重複了多少次,畫面裏有幾個不同的物體,這類問題模型過去錯得很穩定,原因也很樸素,漏採的那幾幀里正好有東西。
Agent終於看得起視頻了
視頻,一直是所有模態裏最貴的那個。
文字便宜,圖片還行,視頻又大又長,一分鐘就能頂掉一本書的token。
所以這兩年所有人聊Agent,更多還是在聊它會讀、會寫、會調用工具。
問題是,一個主要靠文字理解世界的Agent,看到的其實只是一個被人「轉述」過的世界。
攝像頭拍到的、會議錄下的、生產線上跑過去的,那些沒人願意花時間轉成文字的東西,它一概不知道。
現在,這條成本曲線被砍掉一大截。
一個Agent如果能自己翻完幾小時的監控、幾十小時的課程、上百條素材,還不至於把預算燒穿,那它接觸世界的方式就變了。
它不用再等着人把畫面轉述成文字餵給它,也不用再在「看得起」和「看得準」之間選一個。
谷歌,就先做了這個破局者。
AI大戰,下一回合
這幾天,四家的發布節奏,幾乎撞到了一起。
Claude 5.1剛來,OpenAI Astra已經在門口,谷歌憋了幾個月也終於拿出Gemini 3.8 Flash迎戰。
這一波更新後,如今的Claude主攻兩大領域:編程+科研。
下一代Astra將變成一個「持續智能體」,用奧特曼的話來說,其計算機使用能力已達人類水平。
Gemini 3.8 Flash也將在編程方面,有更大的躍升。
現在,OpenAI、Anthropic、谷歌,以及SpaceXAI已經同時開足馬力。
馬斯克預告Grok 4.7十天後發布
這場混戰,才啱啱進入最兇的一段。