回爆文列表

[新聞] Gemini 4 Pro疑偷跑 四大跑分全面領先

📅 2026-09-18 14:22 👤 adamcha (生於安樂 死於憂患) 2 #PTT爆文
原文標題 谷歌Gemini 4 Pro疑偷跑 四大跑分全面領先Astra、Fable 原文連結: https://news.cnyes.com/news/id/6609933 發布時間: 2026-09-18 12:00 記者署名: 鉅亨網新聞中心 原文內容: Google(GOOGL-US)下一代旗艦模型Gemini 4 Pro疑似已「偷跑」上線。流出的基準測試顯 示,該模型在程式編碼、AI代理、推理及電腦操作等多項能力上,均領先OpenAI Astra與 Anthropic Fable 5.1,引發AI圈高度關注。 近日,AI模型競技場Arena出現一款名為「gemini-3.8-flash」的匿名模型,經多名開發 者實測後,被認為極可能是Gemini 4 Pro的早期版本。 Google上一次大幅更新Gemini Pro系列,已是7個月前推出的Gemini 3.1 Pro。Google執 行長皮查伊曾在Google I/O大會預告,Gemini 3.5 Pro將於6月上線,但最終未如期發布 。 匿名模型疑為Gemini 4 Pro 本月初更有消息指出,Google已取消Gemini 3.5 Pro,原因是模型進步幅度有限,表現甚 至不及Flash版本。相較之下,Gemini 4在預訓練階段的評估結果良好,後訓練工作也持 續推進。 如今,Arena突然出現同樣名為「gemini-3.8-flash」的模型,因Google早在9月初就已發 布Gemini 3.8 Flash,同名模型再度現身並不尋常。 多名開發者實際測試後發現,新模型的能力明顯高於既有版本,因此推測它可能是披著「 gemini-3.8-flash」外衣的Gemini 4 Pro首個檢查點版本。 四大測試全面領先 從網路流傳的基準測試圖來看,Gemini 4 Pro在多個項目取得領先。於評估AI代理編碼能 力的DeepSWE v1.1測試中,Gemini 4 Pro獲得約88%的成績,比Astra高出近2個百分點。 在衡量真實知識工作任務的GDPval-AA v2測試中,Gemini 4 Pro是唯一取得2,064分Elo評 級的模型;Terminal-bench 2.1終端編碼測試則拿下95.3%,同樣排名第一。 至於OSWorld-2.0電腦操作能力測試,Gemini 4 Pro獲得86.8%,超越Astra與Fable 5.1。 若相關數據屬實,Gemini 4 Pro不僅在編碼、AI代理及電腦操作方面展現競爭力,價格也 可能低於另外兩款模型。流傳資訊顯示,其每百萬Token輸入價格為2.25美元,輸出價格 為11.25美元。 另有AI研究員進入模型後端後發現,Gemini 4 Pro可能具備1,000萬Token輸入上限、25.6 萬Token輸出上限,以及跨對話永久記憶功能,並能在不使用API的情況下直接連網。 不過,上述規格目前仍未獲Google正式證實。 UI、3D與SVG能力躍進 除了跑分之外,Gemini 4 Pro的實際生成效果也引起討論。 有開發者僅花14分鐘,就利用該模型建立一個以素描、鉛筆及石墨質感為主題的創意展示 網頁,並將「滾動即筆觸」轉化為互動效果,隨著頁面向下滑動,畫面線條也會逐漸加深 。 另一項網頁設計測試則融合賽博龐克與復古未來主義風格,首屏加入3D網格、資料儀表板 及可互動的3D模型,顯示其在介面設計與視覺呈現上的能力有所提升。 在SVG及3D生成測試中,Gemini 4 Pro同樣展現進步。以「鵜鶘騎自行車」為例,模型一 次完成配色、日夜切換、車燈、解剖標註與踏頻控制等多項要求。開發者指出,新模型生 成速度快,對複雜指令的理解也更準確。 Gemini 4 Pro還在10分鐘內完成空中巴士H145直升機的3D模型,並生成像素風3D寶塔。另 一項3D飛行模擬測試中,其畫面效果也明顯優於既有的Gemini 3.8 Flash,進一步加深外 界對兩者並非同一模型的推測。 可直接生成互動遊戲 遊戲開發也是此次實測的重點。Gemini 4 Pro被指能直接產生具完整互動邏輯的小型遊戲 ,包括從頁面架構到各模組設計的《Minecraft》風格作品,以及3D卡丁車競速遊戲,完 成度可與先前公布的Astra測試結果相比。 這些成果顯示,Gemini 4 Pro的能力已不只侷限於文字問答與程式碼生成,而是進一步延 伸至使用者介面、互動網頁、3D模型及遊戲開發等多模態應用。 Google押注遞迴式自我改進 Gemini 4 Pro能力快速提升的背後,也被外界與RSI(遞迴式自我改進)連結。Google DeepMind首席策略長Jasjeet Sekhon上月在柏克萊一場活動中表示,RSI已成為AI巨額投 資邏輯的重要一環。若AI能持續參與並改善自身能力,模型進步速度可能進一步加快。 近期網路更流傳,Gemini 4之所以能提前完成預訓練,是因Google DeepMind已在訓練過 程中建立RSI閉環。Google日前公開的Dream-RSI研究,也聚焦於讓AI代理在探索過程中持 續改善搜尋策略,並從經驗中優化下一輪探索。 不過,Gemini 4 Pro目前的身分、測試成績、價格及技術規格,仍主要來自外流資料與開 發者實測,Google尚未正式公布。 面對OpenAI Astra及Anthropic Fable 5.1,這款匿名模型是否真是Google的新一代旗艦 ,以及最終版本能否維持現有表現,仍有待官方揭曉。 心得/評論: Gemini已經被笑好幾個月了 看起來這次有機會反超另外兩家 只不過前陣子說要放緩研發 現在看起來比較像商業競爭的手段而已 --

鄉民討論

1F cuteSquirrel 說好的減速ㄋ? 14:22
2F wwrand23 這垃圾還有人用嗎 14:23
3F cuteSquirrel 你減速 我偷跑 珍香 14:23
4F STi2011 三巨頭:慢一點 14:24
5F as3366700 從2.5pro開始每次出新東西都吹一遍,每次都被看破手 14:24
6F STi2011 結果每一個都死命沖 每一個! 14:24
7F as3366700 腳 這輩子就風光一次香蕉 吃了別人原本不重視圖像生 14:24
8F laugh8562 真會喇吧 14:24
9F as3366700 成的福利而已 14:24
10F Flyroach 剛出被說超猛→用的人變多→ 變智障 14:25
11F chang1248w 跑分狗 14:25
12F ZO20 蒸餾完了? 14:25
13F loleea 都在輪流超車 14:25
14F OGoTTe 我都沒讀書(考100分) 14:26
15F as3366700 其他家token爆了起碼乖乖承認然後關新訂閱或抬價 14:26
16F yinaser 繼續限算力下就是北美豆包 14:26
17F kducky 喔素喔尊嘟假嘟 14:26
18F as3366700 這家騙一堆人進來之後偷偷把AI降智省token 噁心得要 14:26
19F as3366700 命 信任已經破產了 14:27
20F goshnash 說回家都在玩,考試出來100分 14:27
21F jympin 估狗軟很久了 要重返榮耀了沒 14:28
22F chirex 不是才說要暫緩腳步? 14:28
23F Weky 軍備競賽沒人管根本無解 肯定出大事後大家才會收手 14:29
24F kivan00 互抄算法沒什麼 能經過壓力測試還不降智才是真功夫 14:29
25F deepelves 可是狗狗本來就不是三巨頭阿 14:29
26F EQUP 現在還看不出Open AI就是AI之王的人也就這樣了 14:29
27F trogtor 我都在玩沒在看書準備考試 (考100分) 14:29
28F Juniorlin02 最近真的進步很多很棒 14:29
29F s114752 乾 不是要放緩??? 14:31
30F Juniorlin02 現在還看不出來Google就是AI之王的人也就那樣了 14:31
31F QJP05l8 三巨頭: (別人家的)AI發展必須暫緩 14:32
32F jcgood 真的假的啦,糞G今年爛成這樣已經被丟掉了說,終於 14:32
33F jcgood 可以使用了嗎 14:32
34F u9596g12 傻瓜龍要重返農藥了沒? 14:32
35F u9596g12 整天AI幻覺就G 14:32
36F kill780215 跑分用(^.^) 實際用一天不到又開始降智( ^ ▽^ ) 14:32
37F kivan00 現在消費市場使用的大約還落後LAB裡的兩代 14:33
38F Juniorlin02 chrome、gmail、YT各種服務繼續用,然後邊嘴沒價值 14:33
39F u9596g12 G一開始超猛啊 沒人否認 但降智速度也是離譜 14:34
40F s881720 訂閱一年快到了 推4出來騙續訂 14:34
41F jjjj222 哪家好用就訂哪家, 誰管你跑幾分 14:34
42F fdkevin 要重返農藥了嗎 14:34
43F Juniorlin02 有影響代表一堆人搶著用,你先不要用品質就回來了 14:35
44F coolchife 抓到了。你說的沒錯 14:35
45F uxy82 (你們)跑慢點 14:36
46F gygygy0917 GEMINI 真的是失智AI 有夠難用一直亂回答= = 14:37
47F unrealstars 潘朵拉盒子打開後就停不下來惹,放緩個洨 14:37
48F rhythm7321 終究還是美國豆包 14:37
49F bikevts 開放衝飛天,然後降智鑽地底 14:37
50F kullan 美國豆包別說了 14:38
51F karta018 估狗想害人類滅亡嗎 14:38
52F LoveSports 每一家都是出來沒多久就綁鎖鏈啊 安全至上 14:38
53F as3366700 這家就是先觀望一個月 每次一堆人用就降智省成本 14:38
54F LoveSports 所以要趁前幾個禮拜生成好東西 14:38
55F as3366700 剛開始都假的 14:38
56F chinaeatshit 嗄聊迷你ai 14:38
57F saladbread 關不住,自己跑出來的 14:39
58F tim92 這麼大的藍海市場贏家全拿還信要一起走慢點 14:39
59F LoveSports 我常常不小心繞過去 應該不是降智 是綁鎖鏈 14:39
60F Sianan 遞迴式自我改進看起來很厲害 14:39
61F sheep2009 好了啦 傻龍 14:39
62F hosen 鬼故事又來了,要升息就故意喊減速;只生一碼,新mo 14:39
63F hosen del來了 14:39
64F karta018 新模型都剛開放前幾天最強,後面就越來越笨 14:40
65F A80211ab 每次都說聰明 後來都比別人笨 14:40
66F fallinlove15 三巨頭:大家一起放慢 好不好! 14:40
67F SecondRun 米國豆包怎麼可能強 14:40
68F LoveSports Google闔家歡 鎖鏈一定是綁最多層的 不然賠死 14:40
69F lingsk 我一直停留在它以前AI幻覺超嚴重的事實 14:41
70F ake1234 騙訂閱的時間到了 14:41
71F Gundam77 喊減速都第一個偷跑,小時候被騙,不要長大也被騙。 14:42
72F Gundam77 考試都跟你說沒看書,大家放輕鬆,電動打通宵。 14:43
73F asdasd4522 減速就是她媽的在騙韭菜散戶 14:43
74F Gundam77 誰信誰傻B。 14:43
75F a069275235 彎道超車阿 拿模厲害 14:43
76F LoveSports 沒看書是真的啦 神經多樣性大多有圖像記憶 14:44
77F LoveSports 不要再毀謗說沒看書是騙人的 我國中就是這樣被霸凌 14:45
78F LoveSports 我前幾年考某種考試考榜首 只看一次沒做筆記 14:45
79F LoveSports 神經典型很難理解 可是這不是騙人 14:45
80F p95649564 咕狗: 聽說你們要減速 準備超車 14:45
81F justiceyes 你OK,我先跑 14:46
82F Juniorlin02 有的人就是天資聰穎,看一次就100分,你怪我? 14:47
83F brain9453 超糞 14:48
84F jaxjax 有沒有記憶功能? 14:49
85F Juniorlin02 年底準備繼續續約訂閱,去年半價3250優惠還送5T超香 14:49
86F max0616 你信不信 我反正是信了 14:49
87F rhrh1129 繼續用GPT-6 有夠好用 14:49
88F klwei 太卑鄙了 14:50
89F mynumber55 好了啊,是要騙幾次 14:51
90F g5637128 彎道超車 14:51
91F oyaji5566 google ai studio講出來沒人聽過,根本沒人用g家a 14:52
92F oyaji5566 i寫程式 14:52
93F Juniorlin02 GPT送我都不屑用,Google體系用起來未來完美整合 14:52
94F deann 說好大家要放緩新模型開發的 14:52
95F joygo 他每次都說的很厲害 實際上都很哭 14:53
96F salamender 可愛龍等等就變身了 14:53
97F Juniorlin02 未來自動讀信自動導航整合GOOGLE眼鏡的完美小秘書 14:53
98F joke3547 老G家別掙扎了,贏不了O家跟A家的 14:54
99F Beakidd 屁啦,Gemini笨得要死,新模型能超車? 14:56
100F waitrop 難道只有我一個人在用 14:56
101F super0949 又輪到google的回合了嗎 14:56
102F coveted 給密你超爛阿,越改越喜憨 14:57
103F Erechtheus 以為唯一減速的才是拼命衝的那個? 14:57
104F LoveSports 我每天都有用 spark幫我收集新聞 比自己找的多樣化 14:57
105F baka1412 https://i.imgur.com/iqhcdVz.jpeg 14:58
106F Nitricacid 狗家模型每次都大吹一個月就被吹死了 14:58
107F onekoni 三個綁在一起喊放慢結果一個比一個急 14:58
108F Juniorlin02 難道是名字取得太酷炫?還有N個人不知到唸這麼奈 14:58
109F LoveSports 送google health premium AI教練是AI代理自動給意見 14:58
110F LoveSports 信箱也是給AI整理 14:59
111F Juniorlin02 當然每天新聞自動推播阿,就等google牌眼鏡出爐 14:59
112F seemoon2000 沒人信吧 gemini專門做跑分模型 15:01
113F seemoon2000 現在已經爛到他連自己本來的優勢都做不好 問他YT影 15:02
114F seemoon2000 片摘要 他也會回我只是語言模型 沒辦法處理這問題 15:02
115F ilGroundhog 看看就好Gemini降智最快 15:02
116F LewisRong 不讓了不讓了 15:02
117F tongmove0503 模型剛出好強,過一陣子又變智障 15:02
118F Shepherd1987 出來再說 15:03
119F LoveSports 因為詐騙跟犯罪者太多所以有些功能有被鎖 15:03
120F LoveSports 我有時候不小心繞過去 問他們才承認的 15:03
121F LoveSports 一般情況不會講解為什麼要鎖功能 15:03
122F followwar 現在不是都是拚harness 15:04
123F gwofeng 測分後就降智 15:05
124F stlinman Gemini重返農藥?! 15:06
125F Juniorlin02 問得太XX才會被嗆只是語言模型吧?還是免費仔? 15:07
126F Juniorlin02 訂閱pro從來沒遇過那個狀況 15:08
127F seemoon2000 我就是pro啊 還買一年 15:08
128F fallinlove15 沒差不多就那樣了 再來要看誰用最少的資源跑出相應 15:09
129F fallinlove15 的成果 15:09
130F super0949 盤前沒啥反應 繼續等 15:09
131F HaHaPoint 喔喔喔 真的假的 15:09
132F Juniorlin02 那你還要好好上課學習,怎麼用AI絕對有差 15:09
133F async 這次看到很多測試的操作影片 真的強很多 15:09
134F seemoon2000 可以理解 反正一個摘要 他第我次拒答 我開3 4次。 15:10
135F seemoon2000 session他總會答的 反正他就是這麼用的 15:10
136F Centurio 去年年繳的快到期了,趕快出個厲害的騙續訂後,又可 15:10
137F Centurio 以廢一年了 15:10
138F liaon98 說減速 然後每個都在偷跑 笑死 15:10
139F comboday 減速=你們跑太快等等我 15:10

免責聲明: 本文內容擷取自 PTT Stock 板爆文,推文版權歸原作者所有。本站僅進行自動化整理與情緒標記,不代表任何投資建議。投資前請審慎評估,並自負風險。

Wave 訊號
--
--
×
系統公告
--
--
×