最近各家模型商的更新速度真的快到讓人有點喘不過氣。Google 才剛發布 Gemini 3.6 Flash 不到三週,馬上又推出了 Gemini 3.7 Flash。這則新聞,除了常規的性能提升,Google更明確地把目標對準了「程式碼編寫(Coding)」與「AI 代理(Agents)」這兩個實戰場景。
新聞重點:更聰明、更便宜的日常使用模型
根據 Google 官方發布的資訊,Gemini 3.7 Flash 被定位為最具智慧的「主力(Workhorse)」模型。這款模型在處理複雜任務的推理與準確性上有顯著進步,特別是在生產等級的程式碼生成與網頁開發方面。
以下是這次更新的幾個核心數據:
* 程式開發表現提升: 在 FrontierCode 1.1 Main 測試中,生產等級程式碼的準確率從 3.6 版本的 34.4% 提升至 43.6%;在 DeepSWE v1.1 測試中,更是從 49.0% 大幅進步到 65.3%。
* 複雜文件與自動化: 針對金融、法律等領域的複雜文件理解(GDP.pdf 測試),準確率從 22.0% 提升至 34.0%。在衡量業務流程自動化的 AutomationBench 測試中,得分也翻倍成長。
* 開發者體驗與定價: Google 強化了模型的多步驟規劃與工具調用(Tool calls)能力,旨在減少開發者的人工監督。定價方面,年底前的入門價格為每百萬輸入 $0.75 美元,每百萬輸出 $3.75 美元,這是 3.6 Flash 原始成本的一半。
* 產品整合: 針對 Google AI Pro 與 Ultra 訂閱者的「Gemini Spark」代理服務,即日起已改用 3.7 Flash 模型。
我的觀察:AI 市場的「性價比」內捲
首先,我認為 Gemini 3.7 Flash 的定位非常明確。它不打算去爭奪那個「世界最強」的模型,而是聚焦在泛用、快速、平價。以目前的價位與能力來看,甚至只要你對回應速度沒有那種毫秒級的極致要求,它幾乎可以無痛替代更輕量的模型( Gemini 3.5 Flash Lite )。我認為這是一種「加量不加價」的策略,讓使用者用極低的成本換取大幅提升的產出品質。
其次,關於 API 價格的「單向通縮」。雖然 Google 說現在是年底前的優惠價,但在目前 AI 市場競爭如此激烈的態勢下(例如 Grok 等強敵環伺),我認為價格一旦降下來就很難回去了。API 成本下行已經是不可逆的趨勢,這類主力模型的定價競爭,長遠來看只會越來越激烈。
最後是關於「訂閱制」與「API」的抉擇。雖然 API 很有彈性,但對一般使用者來說,隨用量計費的心理負擔較重。 Google 將新模型整合進 Gemini Spark 訂閱服務中,這顯示出他們也明白:多數使用者仍會優先選擇成本可預測、介面整合良好的訂閱制服務。但是目前在選擇上,Google還缺少一個頂尖模型,這在訂閱制的競爭能力下,較困難的任務還少一塊拼圖,多少會讓人覺得有點可惜。

這件事值得繼續觀察什麼
1. 旗艦模型的地位: 當 Flash 系列(次前沿模型)的能力顯著提升後,Google 更高階的 Pro 系列模型是否能拉開足夠的差距?如果差距縮小,使用者可能會更傾向轉向跨平台的「組合拳」搭配,而非單一生態系。
2. AI 代理的普及點: 這次大幅強調「多步驟規劃」與「工具調用」的進步,加上成本降低,這可能意味著企業級 AI 代理的大規模部署,已經快要達到成本與技術的平衡點。
3. 垂直領域的威脅: 從數據來看,通用模型在金融、法律等專業領域的推理能力補齊得很快,這對那些專做垂直領域 AI 的初創公司來說,可能是個不小的挑戰。
原文連結:https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/



