園丁的AI練習手記
回到首頁
[個人小記]2026-07-24閱讀時間 5 分鐘

【個人小記】從 Artificial Analysis 數據看Gemini 3.6 Flash、模型智能與成本的權衡

#AI模型評測#Fable 5#GPT-5.6#Luna#Sol#Gemini 3.6 Flash
【個人小記】從 Artificial Analysis 數據看Gemini 3.6 Flash、模型智能與成本的權衡

最近新發表的模型真的很多,在今年 4 月以前,我其實很多工作都還是會使用 Google 的 Gemini,但後來開始接觸 Codex 之後,目前我大部分的使用情境都落在其中了。現在網頁版的 AI 對我來說,多數只是用來節省流量,做一些簡單的問答還有資訊文章的整理。

原本我打算找個時間測試一下 Gemini 3.6 Flash 的能力,想說在實作之前先去 Artificial Analysis 網站看一下相關的比較資訊。結果不看還好,看完數據並進行比較後,也難怪近期 Gemini 會有比較多逆風的言論。

新聞重點:Intelligence Index v4.1 評測結果

Artificial analysis 評比結果 (模型智能)
Artificial analysis 評比結果 (模型智能)

根據 Artificial Analysis 最新發布的 Intelligence Index v4.1(2026/07/03),這份報告評測了當前領先模型的智能、速度與成本:

* 智能排名:Claude Fable 5 (with fallback) 以 59.86 分位居榜首,緊隨其後的是 GPT-5.6 Sol (max) 的 58.89 分及 Kimi K3 的 57.11 分。

* 成本效益:在每項任務的加權平均成本中,DeepSeek V4 Pro (max) 以 0.0448 美元成為最經濟的選擇。相比之下,智能最高的 Claude Fable 5 成本高達 2.7498 美元,兩者差距巨大。

* 輸出速度:gpt-oss-120b (high) 以每秒 267.2 個 Token 領先,Gemini 3.6 Flash 則以 251.3 個 Token 位居第二。

* 新評測維度:新增了「Coding Agent Index」衡量 AI 代理在軟體工程任務的表現;以及「AA-Briefcase」針對長程知識工作(如製作簡報、試算表)的 Elo 排名,此項由 Claude Fable 5 奪冠。

我的觀察:Gemini 的困境與 Luna 的甜蜜點

如果把看一個模型的能力分成「模型智能」、「推論速度」與「完成單位任務的費用」三個維度, Gemini 系列目前只有推論速度稱得上是前段班。

但問題在於,推論速度快但卻不能符合使用者需求,再快都不會被採用。尤其在一些不能犯錯的場景,尤其是企業應用,穩定可靠的結果比速度更重要,這正是目前 Gemini 發展的限制。

況且不論目前最強的 Fable 5 還是 GPT-5.6 Sol。甚至在模型智能表現上,Gemini 3.6 Flash 都不若近期發表的 Grok 4.5 還有 Muse Spark 1.1。更慘的是,智能比不上就算了,連單位任務的費用也比這兩個模型高。對於有在計算效率的個人或是企業來說,一定不會選擇一個又貴又比較笨的模型,這反映了 Gemini 3.6 的潛在危機。

另外想提的是,上次介紹 GPT-5.6 系列時提到的 Luna,目前確實成了我大量使用的模型。從評比數據來看,Luna(Max) 的智能、費用與速度都在一個相當「甜蜜」的位置。就我自己的情境,除了有 Coding 需求會用 Sol,日常排程 Luna 真的是好選擇。

文章圖片

這件事值得繼續觀察什麼

1. Google 的反擊:如果 Gemini 3.5 或 3.6 Pro 能儘快發表,且智能表現能超越競爭對手,即便價格稍貴,依靠 Google 強大的生態系,或許還能保有較高的採用率。

2. 極致性價比的應用:DeepSeek V4 Pro 的成本僅為 Claude Fable 5 的 1.6% 左右,這種極低成本是否會帶動大規模自動化任務的普及,值得觀察。

3. 高速推論的價值:雖然目前 Gemini 處於逆風,但高速推論在搜尋等即時應用上仍有優勢。如果 Google 能在提升智能的同時保有速度優勢,競爭力依然可怕。

這場模型競賽還在早期階段,未來還有很多好戲可以看。我們做的就是持續參與並見證這場 AI 革命。


原文連結:https://artificialanalysis.ai/?intelligence-efficiency=cost-per-task&intelligence-category=text-only-vs-multimodal#coding-agents

Read more

【個人小記】全班平均 96 分變成 48 分:布朗大學的一場 AI 作弊疑雲與我的反思
[個人小記]2026-07-134 分鐘

【個人小記】全班平均 96 分變成 48 分:布朗大學的一場 AI 作弊疑雲與我的反思

布朗大學教授羅伯托·塞拉諾(Roberto Serrano)因居家測驗出現異常高分(96分),懷疑學生大規模使用 AI 作弊。期末考改回實體後平均分驟降至 48.6 分,引發學術誠信與 AI 教育應用的熱烈討論。本文整理新聞重點並探討 AI 便利性如何影響獨立思考,以及校方行政程序在面對新技術挑戰時的困境。

【個人小記】當 AI 開始學著感知世界:Anthropic 的物理代理實驗 Project Fetch 觀察
[個人小記]2026-06-215 分鐘

【個人小記】當 AI 開始學著感知世界:Anthropic 的物理代理實驗 Project Fetch 觀察

本文整理 Anthropic「Project Fetch」第二階段實驗報告,分析 Claude Opus 4.7 在操作機器狗任務中,如何達成比人類快 20 倍的速度與僅十分之一的程式碼量。作者提出「物理代理 AI」的概念,探討 AI 如何從數位邏輯跨越到物理感知,並分析 AI 像新生兒般學習物理世界的未來趨勢與挑戰。