![]()
智東西
編譯 楊京麗
編輯 李水青
智東西7月22日消息,今天凌晨,谷歌發布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款模型,重點提升Agent工作流所需的Token效率、響應速度和運行可靠性。
![]()
▲谷歌發布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber(圖源:X)
其中,Gemini 3.6 Flash面向編程、知識工作和多模態任務,在第三方評測機構Artificial Analysis的Intelligence Index(智力指數)中,其任務Token消耗量比3.5 Flash少17%,在DeepSWE測試中的輸出Token消耗最多減少約65%。
Gemini 3.5 Flash-Lite主打低延遲和高吞吐量,生成速度達到每秒350個輸出Token,在Agent工作流中較前代的Flash-Lite模型也有較大提升。
Gemini 3.5 Flash Cyber則專門用于發現和修復網絡安全漏洞,將其與CodeMender代碼安全Agent配合使用,性能已達到前沿模型的競爭水平,與Mythos 5和GPT-5.6 Sol能力相當,不過暫不面向普通開發者開放。
目前,在Artificial Analysis榜單上,Gemini 3.6 Flash速度測評成績優秀,但智力和成本的優勢相對不明顯:該模型的Intelligence得分只有50,落后于Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2,連Meta的Muse Spark 1.1也排在它前面;其單任務成本達到0.50美元(約合人民幣3.39元),較DeepSeek、MiniMax、GLM、Muse Spark、Grok等模型更貴。
![]()
▲Gemini 3.6 Flash在能力、速度和成本上與其他模型對比(圖源:Artificial Analysis)
作為昔日大模型“御三家”之一,谷歌此次最突出的優勢仍然是速度。目前,Gemini 3.5 Flash-Lite和Gemini 3.6 Flash在輸出速度上,位列榜單前兩位。
![]()
▲Gemini 3.5 Flash-Lite和Gemini 3.6 Flash位列模型輸出速度榜前兩位(圖源:Artificial Analysis)
對于等了兩個月的用戶來說,這次發布多少有些“等錯了人”。今年5月,谷歌CEO桑達爾·皮查伊(Sundar Pichai)在I/O大會上預告,Gemini 3.5 Pro將在6月推出;如今7月已經過半,用戶還是沒有等來3.5 Pro。
對于這款遲到的Gemini 3.5 Pro,谷歌稱該模型正在與合作伙伴測試,將在準備就緒后盡快發布。與此同時,谷歌提前預告Gemini 4,稱已啟動公司迄今規模最大的預訓練任務。鴿了我們兩個月的谷歌又畫了兩張新“餅”,也算是“不負眾望”。
一、3.6 Flash:輸出Token最多減少65%,編程、知識工作提升明顯
Gemini 3.6 Flash基于開發者和企業客戶對3.5 Flash的反饋改進。在處理多步驟工作流時,新模型需要的推理步驟和工具調用次數更少,同時減少了輸出冗余。
3.6 Flash的輸入價格為每100萬個Token 1.5美元(約合人民幣10.2元),輸出價格為每100萬個Token 7.5美元(約合人民幣51元),輸出價格低于3.5 Flash,輸入價格不變。
3.6 Flash大幅降低了每項Agent任務的運行成本。在DeepSWE v1.1測試中,3.5 Flash平均每項任務消耗約27.6萬個輸出Token,3.6 Flash降至約9.7萬個,降幅接近65%;在Artificial Analysis Intelligence Index中,兩款模型的平均輸出Token消耗分別約為2.8萬個和2.3萬個,Gemini 3.6 Flash的Token消耗量降低約17%。
![]()
▲Gemini 3.6 Flash和Gemini 3.5 Flash任務輸出Token對比(圖源:谷歌)
在軟件工程Agent評測DeepSWE v1.1中,3.6 Flash得分為49%,高于3.5 Flash的37%和3.1 Pro的12%;在機器學習工程測試MLE-Bench中,3.6 Flash得分為63.9%,領先3.5 Flash的49.7%和3.1 Pro的42.6%。
知識工作測試GDPval-AA v2中,3.6 Flash、3.5 Flash和3.1 Pro的得分分別為1421、1349和965;在測試Computer Use(計算機操作能力)的OSWorld-Verified中,三者得分分別為83.0%、78.4%和76.2%。Computer Use現已成為Gemini API和Gemini Enterprise中的內置客戶端工具。
![]()
▲3.1 Pro、3.5 Flash和3.6 Flash其他能力對比(圖源:谷歌)
同時,谷歌還展示了模型的應用案例,Gemini 3.6 Flash能夠更高效、準確地分析金融數據和電話會議記錄、通過多Agent協作執行代碼遷移、為3D工作流開發照片紋理提取工具,以及結合tldraw離線編輯器創建交互式主題設計工具。
在代碼遷移任務的對比測試中,Gemini 3.6 Flash的規劃耗時為20秒,低于3.5 Flash的24秒;執行遷移的時間則由2分08秒縮短至1分20秒,整體耗時減少約34%。根據案例展示的信息,3.6 Flash生成了更詳細、結構更清晰的代碼審計與驗證文檔,覆蓋數據模型、API接口、業務邏輯、UI組件等多項針對性驗證任務。
![]()
▲Gemini 3.5 Flash和Gemini 3.6 Flash在代碼遷移任務中耗時對比(圖源:谷歌)
多家早期客戶也給出了反饋。設計軟件公司Figma認為,3.6 Flash在質量、速度和成本之間取得了較好平衡,可以加快原型探索和迭代;法律AI公司Harvey稱,該模型在文檔起草和審查任務中平均快12%;開發工具公司JetBrains稱,其低推理等級下的編程性能較上一代Flash提高了10%至20%。
安全方面,3.6 Flash加強了針對化學、生物、放射性與核風險以及網絡攻擊濫用的前沿安全防護。谷歌稱,這些措施提高了模型抵抗越獄攻擊的能力,同時盡量減少對正常用途的錯誤拒絕。
二、3.5 Flash-Lite:每秒輸出350個Token,部分測試超過3 Flash
Gemini 3.5 Flash-Lite是Gemini 3.5系列中速度最快、價格最低的模型,主要面向Agent搜索、文檔處理等強調低延遲和高吞吐量的任務。
根據Artificial Analysis的數據,該模型每秒可以生成350個輸出Token。其輸入和輸出價格分別為每100萬個Token 0.3美元(約合人民幣2元)和2.5美元(約合人民幣17元)。
開發者可以根據工作負載調整模型的思考等級:在大規模、低成本任務中選擇minimal或low等級,在需要處理多步驟子Agent任務時啟用更高等級。3.5 Flash-Lite同樣內置了Computer Use工具。
與3.1 Flash-Lite相比,3.5 Flash-Lite在Agent終端編程測試Terminal-Bench 2.1中的得分從31%升至54%;在長上下文測試GDM-MRCR v2中,得分從60.1%升至72.2%;在知識工作測試GDPval-AA v2中,得分從642升至1140。
![]()
▲Gemini 3.1 Flash-Lite與Gemini 3.5 Flash-Lite對比情況(圖源:谷歌)
3.5 Flash-Lite在部分測試中還超過了定位更高的3 Flash。在SWE-Bench Pro中,Gemini 3.5 Flash-Lite和Gemini 3 Flash兩款模型得分分別為54.2%和49.6%;在OSWorld-Verified中,兩者得分分別為74.0%和65.1%。
![]()
▲Gemini 3 Flash和Gemini 3.5 Flash-Lite對比情況(圖源:谷歌)
美國金融科技公司Ramp認為,Gemini 3.5 Flash-Lite在票據提取任務中較好地平衡了準確率、延遲和成本。
![]()
▲美國金融公司Ramp對Gemini 3.5 Flash-Lite的評價(圖源:谷歌)
三、網絡安全模型:搭配Agent使用,暫不面向普通開發者開放
第三款模型Gemini 3.5 Flash Cyber基于3.5 Flash微調,專門用于發現、驗證和修復網絡安全漏洞。相比體量更大的模型,其Token價格更低,適合規模化檢查代碼安全問題。
該模型將與谷歌代碼安全Agent CodeMender配合使用。CodeMender會同時運行多個3.5 Flash Cyber Agent,最后將不同Agent的分析結果合并成一份報告。
在CyberGym測試中,CodeMender最多調用5次模型時,3.5 Flash Cyber得分為83.2%。該模型在測試中的表現接近OpenAI和Anthropic的前沿模型,Anthropic Agent內的Mythos Preview得分為83.1%,OpenAI Agent內的GPT-5.6 Sol得分為83.6%,Anthropic Agent內的Mythos 5得分為83.8%,OpenAI Agent內的GPT-5.5-Cyber得分為85.6%。
![]()
▲Gemini 3.5 Flash Cyber在CyberGym測試中的表現(圖源:谷歌)
考慮到漏洞發現和修復技術具有明顯的雙重用途,谷歌暫不向普通開發者開放3.5 Flash Cyber。該模型近期將通過CodeMender啟動小范圍試點,僅供政府機構和可信合作伙伴使用。
四、兩款模型均已上線,3.5 Pro仍在測試
目前,Gemini 3.6 Flash和3.5 Flash-Lite已經通過Google AI Studio、Android Studio及Gemini API向開發者開放,其中3.6 Flash還進入了Google Antigravity。
企業客戶可以通過Gemini Enterprise Agent Platform使用這兩款模型,3.6 Flash同時接入了Gemini Enterprise應用。普通用戶可以在Gemini應用中使用兩款模型,3.5 Flash-Lite還將逐步接入谷歌搜索。
Gemini 3.5 Pro目前仍處于合作伙伴測試階段,谷歌計劃在準備完成后擴大開放范圍。
結語:Gemini從追求單次性能,轉向降低Agent總成本
谷歌此次更新Flash系列,重點轉向降低Agent的實際運行成本。Gemini 3.6 Flash顯著減少了完成任務所需的輸出Token、推理步驟和工具調用次數,Gemini 3.5 Flash-Lite則進一步提升了生成速度。對于需要大規模部署Agent的企業和開發者來說,更低的成本和更快的響應速度仍具有實際吸引力。
不過,從Artificial Analysis等第三方榜單來看,Gemini的Flash系列模型能力目前難以保持領先。上周,月之暗面發布Kimi K3,其Intelligence得分僅落后于Claude Fable 5和GPT-5.6 Sol,在前端編程測試中甚至排到了榜首。
國產模型已經從跟隨者變成全球前沿模型競爭中的重要力量,谷歌面對的對手也遠不止OpenAI和Anthropic。至于谷歌能否重回昔日“御三家”的牌桌中,恐怕還要看已經延期的Gemini 3.5 Pro,以及剛剛開始預訓練的Gemini 4。
來源:谷歌、X、Artificial Analysis
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.