4個月4個Flash,Gemini到底在下什麼怪棋?

差評
09/04

四連超凡 Quadra kill,不是遊戲,而是 Gemini 又雙叒叕發新的 Flash 模型了。

出於刻板印象和谷歌低調的宣發,這次的 Gemini 3.8 Flash 世超本來沒太上心。

但意外的是,網上風評很不錯,尤其是編輯部的谷歌老粉,紛紛感慨:

難道說,Flash 纔是對的?

看官方的跑分表,確實會被唬住,因為它拉來對標的,已經是 Claude 和 GPT 的旗艦模型了。

最有衝擊力的提升都集中在「幹活」兩字上。

DeepSWE 這項,主打長線的編程開發能力,已經摸到了 Claude Opus 5 的屁股,只差 0.3%。

而像傳統測 Agent 能力的 Terminal-bech,它在 2.1 版的測試裏也是力壓全場,豪取 89.45%;

不過在上個月更新的 4.0 版中,它又拉了個 19.1%,能力泛化差點意思。

除此之外,多模態成績還算強勢,科研,金融分析等專業領域,也小有進步。

而且翻開更具體的模型卡片能看到,3.8 Flash 的世界知識來到了 26 年的 3 月份,腦子裏終於更新了點新東西。

但難崩的是谷歌很快打了個補丁,說只有部分領域是新的,很多老領域仍然是雷打不動的 25 年 1 月。。。

當然,重頭戲還是性價比,3.8 Flash 這次性能跑分庫庫漲,但吐 token 的速度仍舊一瀉千里。

看 Artificial Analysis 的排行榜,大夥兒多半是兩位數,就它幹到了三百多

不過話說回來,比起之前,它執行起任務的速度反而要慢一些。

因為谷歌說 3.8 Flash 在工作中會更努力的調用工具,推理更多步驟,這樣活兒會幹得更漂亮,代價就是拉長交付時間。

價格這塊兒也挺有活兒,雖然 Flash 的便宜大碗衆所周知,但直接貼到跑分表裏頭兩行,大寫特寫的,咱還是頭一回見。

我們也簡單實測了一下,省流就是除了快還是快,幹活兒不懶,智商一般,但寫東西意外的挺有人味兒。。。

比如同樣生成一篇文章,講述最近 DLSS 5 有爭議的內容。

GPT 5.6 這兒東拼西湊兩分半開始下筆,但你一下就能品到 AI 味兒,直衝天靈蓋兒。

像「不是而是」這種已經是老版本了,現在是三五個字兒一句話,配合莫名其妙的設問,再點綴上無窮無盡的排比,讀起來斷斷續續的,非常割裂。。。

Gemini 3.8 Flash 則是另一種畫風,3000 字的稿子,17 秒足矣,多一秒都是對 Flash 的褻瀆。

遣詞造句的習慣也完全不同,風格更犀利,樂意用一些網絡熱梗去類比。

雖然偶爾顯得用力過猛,但場景的渲染和情緒的遞進都絲滑很多,讀起來也流暢一些,起碼沒那麼乏味。

不過你仔細看完,就會發現,這倆純偏科生來的,Gemini 雖然說人話了,但它論證的準確度遠不如 GPT 嚴謹。

接下來的 Coding 測試,表現就沒有跑分看起來那麼猛了。

先來個常規的 3D 場景建模,用網頁還原二遊那種渲染的質感,造個日式便利店。

就結果來看,確實達不到原作者 Demo 中 Claude Opus 5 的那種質感。

模型整體的規格和樣式基本沒錯,但內部的細節就少了太多,而且光影效果也沒按提示詞來,整體的濾鏡色調都差了個檔次。

作為對比,下面又拿 GPT 5.6 Terra 和 Kimi K3 跑了一輪,雖然跑分表上他們旗鼓相當,但這倆的質感明顯好很多。

超市的門能打開了,模型邊緣也加了非常靈魂的黑色描邊,多了很多二次元風格化的處理細節。

依次為GPT 5.6 Terra和Kimi K3

接下來加大難度,讓它復刻經典的 Minecraft 遊戲。

如果是網頁版,配上一句話的提示詞,那你將體驗到竄稀一樣的速度,它不到一分鐘就能搓出來。

雖然跟預想的一樣拉完了,但好在沒啥 BUG,方塊能挖也能放,主打一個簡約。

而如果升級一下,用谷歌 AI Studio 的那套工具打輔助,那質感撓一下就上來了。

細節更接近 Minecraft 原版,方塊的類型更多,玻璃草地的材質也很還原,尤其是遊戲本體的功能性更豐富了,菜單有更多設定選項,遊戲中也多了揹包之類的複雜系統。

能看出來,有工具跟沒工具的 Gemini 3.8 Flash 是兩個玩意兒。

所以我乾脆安裝了 Antigravity,谷歌官方的本地 Agent 工具,看看更專業的 Harness 加持下,會不會有更好的效果。

不過還是得吐槽一下,比起 Codex,WorkBuddy 之類的應用,Antigravity 的使用體驗就是一坨,沒有中文適配,沒有技能商店,第三方插件寥寥無幾,一切都透露着原始美。。。

言歸正傳,這一版的 Minecraft 我讓它結合一下漫威蜘蛛俠的玩法,能在城市間蕩蛛絲。

這回沒那麼快了,花了大概 8 分鐘,它才把成品掏出來。

地點設定在紐約的曼哈頓,Minecraft 的玩法都還在,方塊都轉化成了更適配主題的現代化材質。

可能是因為在執行前寫了計劃書的原因,完成度明顯高了很多。

比如很多地標建築,像帝國大廈,跨海懸索橋,拿方塊還原的都不錯,過河小橋,路燈這些小細節也不少,連史蒂夫本人都換成了 Spiderman 的皮膚。

不過這個蕩蛛絲的玩法物理判定太複雜,它修了好幾輪都還有 Bug,Spiderman 的速度詭異,一會兒飛起,一會兒卡住,在大樓之間來回抽搐抖動。

最後我又測了一下代碼理解能力,讓它去 GitHub 上把 DeepSeek Harness 拉下來,做個方便理解代碼倉庫的 wiki。

花了十分鐘,它把項目從頭到尾讀了一遍,然後搓出了 wiki。

內容倒是沒偷懶,架構設計,接入的協議,以及後續二次開發的標準都扒了出來。

但審美這塊兒還是祖傳的 AI 味兒,後續我讓它自己裝個 skill,然後重構一下前端。

結果它老毛病又犯了,2 分鐘安裝執行糊弄完畢,風格切換就是換個色兒,翻開思維鏈能看到,skill 裝是裝了,但只調用了一半兒就自作主張交差了。。。

這通測試下來,也能感覺到 Gemini 3.8 Flash 的尷尬之處,它執行速度奇高,但又有一堆莫名其妙的小毛病。

有前面 4 個月 4 個 Flash 模型的積累,沒人比谷歌更懂 Flash 的性價比,所以執行效率沒啥毛病。

但小毛病這塊兒又確實影響體驗,像 Minecraft 這個任務,網頁版,AI Studio 和 Antigravity 的產物存在明顯差距。

工具越少,約束越鬆散,它就越隨心所欲。反之如果有靠譜的 Harness 去約束,有清晰的規劃和邊界,那它又會聽話很多。

所以只能期待一手谷歌給 Harness 的升級,給模型補上能動的手腳,到時候就知道 Flash 這條路到底是夯還是拉了。。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10