最近看到 Gartner 的一份報告,提到一個的現象:雖然大型語言模型(LLM)的代幣(token)單價一直在降,但企業在 AI 上的總支出反而可能暴增。這跟我最近在實作 AI Agent(代理)時的感受很像,這種「推論悖論」是實務上必須要留意的。
新聞重點:什麼是推論悖論?
根據 Gartner 的預測,到 2030 年,代幣成本將下降 95%,這聽起來是個好消息。然而,未來兩年內,AI 代理工作流的推論成本反而會增加五倍以上。
為什麼會這樣?主要原因在於「AI 代理」與傳統「聊天機器人」的運作邏輯完全不同:
* 運作方式: 聊天機器人通常只需給出一個合理的答案;但 AI 代理需要進行推理、拆解任務、與其他代理溝通,並在背景持續運行。
* 代幣消耗: 為了完成同一個任務,代理所需的代幣數量可能是聊天機器人的 5 到 30 倍。
* 成本差異: 具備推理能力的代理,單一任務成本可能比基礎機器人高出 150 倍。
Gartner 分析師將此稱為「代幣通縮幻覺」。簡單來說,雖然單價便宜了,但因為我們讓 AI 做的事情變得更複雜、呼叫次數更多,總帳單反而會變厚。
我的觀察:為了品質,一定程度內,成本上升是合理的交換
針對這個現象,我有幾點實務上的觀察:
首先,我認為架構複雜化是必然的,成本上升則是合理的交換。現代 Agent 為了確保產出品質,必須承擔任務拆解、子代理協作到自我審核的多階段循環。雖然這顯著增加了代幣消耗,但對於追求穩定與正確性的企業級應用來說,多付出一點開銷來換取高品質、可用的結果,是非常划算的。
其次,我發現真正的瓶頸往往在「時間」而非單純「成本」。相較於運算開銷,多層審查與連鎖代理所帶來的端到端時間延遲(Latency),對使用者體驗的衝擊往往更直接。當代理在背景「思考」太久,業務節奏就會被打斷。
最後,關於如何應對,我認為「推論分層」與「平行處理」是關鍵。我們不應該讓所有簡單任務都去跑最貴的模型。在硬體技術演進的過渡期,或許採用預先分配並平行執行的架構,是未來模型調用下需要考慮的,雖然這可能會浪費一些代幣,但能有效壓縮等待時間。

這件事值得繼續觀察什麼
1. 企業預算編列的轉變: 財務長(CFO)是否能理解「單價下降、總價上升」的邏輯?企業需要更精細的 ROI 衡量標準,而非只看代幣單價。
2. 專用推論硬體的普及: 隨著需求暴增,未來是否會出現更多如 LPU 這種專門加速推論的硬體,來緩解延遲與成本問題。
3. 模型編排能力的競爭: 未來的競爭力可能不在於誰的模型最強,而在於誰能最有效率地調度不同成本、不同層級的模型來完成任務。
原文連結:https://www.computerworld.com/article/4210786/ai-inference-is-getting-cheaper-but-your-agents-are-getting-more-expensive.html



