最近看到 Google DeepMind 發表了名為 「Gemini Robotics ER 2」 的具身推理模型(讓AI擁有「大腦」與「身體」的結合能力,讓它能看懂現實環境、思考該做什麼,並指揮機器人動手完成任務)。雖然大家最近可能覺得 Google 在旗艦大模型的進展上稍微慢了一點,但他們在特定領域(如機器人、企業 AI 資源)的迭代其實依然紮實。這則新聞展示了 Google 如何將 AI 的推理能力真正落實到物理世界的移動與操作中。
新聞重點
Gemini Robotics ER 2 被定位為機器人的「高階大腦」。它的核心突破在於將「思考」與「執行」分離:ER 2 負責高階的任務規劃與推理,而具體的馬達動作則交給底層的視覺-語言-動作(VLA)模型。
這款模型有幾個技術亮點:
1. 時間智能(Temporal Intelligence):這讓機器人能精確判斷任務何時完成。例如,它能以 91.3% 的準確度判斷咖啡何時倒滿,且延遲低於一秒。
2. 即時性與工具編排:透過 Gemini Live API,機器人可以一邊執行動作一邊持續思考,減少了過去機器人常見的「停頓思考」現象。
3. 多機器人協作:支援不同類型的機器人(如輪式與人形機器人)協同工作,並能從原始影片串流中偵測執行錯誤。
4. 安全機制:當偵測到人類接近時,模型會主動停止動作,Google 稱其為迄今最安全的模型。
我的觀察
Google 身為科技巨頭,其商業佈局非常深遠,我們外人很難以去猜想他們的下一步策略是什麼。雖然表面上旗艦模型的聲量有起伏,但看看他們在人才與資源上的儲備,若說他們會追趕不上目前前沿的AI模型開發者,那倒還未必,其實目前除了Gemini 的 Pro 系列模型延遲外,他們在這種跨領域的整合(AI + 機器人)一些企業應用等等的方面還是可以常常看到Google耕耘的痕跡。
而這則新聞中最讓我覺得有趣的是這個新發表模型,對「精準度」要求的例子。我們人類覺得把咖啡倒滿或繫好垃圾袋是很簡單很直覺的瑣事,但在機器人領域,單靠影像判斷往往會因為延遲而導致咖啡溢出。ER 2 針對這種關鍵時刻進行預判,大程度上解決了這種人類看似習以為常、但在工程技術上卻是巨大挑戰的問題。
或許有些人可能會覺得這只是一個小小技術門檻,但我認為科技的進步就是靠這些微小的累積。關注這些細節,能讓我們更理解產品開發的真實困境,去理解工程其實並不是這麼簡單,很多時後一個基本的小動作中,或許就隱含著一些工程難題在其中。
這件事值得繼續觀察什麼
1. 具身 AI 的架構標準化:這種「高階大腦(推理)」與「低階執行(動作)」的分工,是否會成為未來機器人開發的主流架構?
2. 多機協作的商業化:當不同形態的機器人(輪式、人形)能透過同一個 AI 腦袋協作,這對自動化倉儲或居家照護的實用性將有大幅提升。

原文連結:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/



