園丁的AI練習手記
回到首頁
[科技時事]2026-08-03閱讀時間 5 分鐘

【科技時事】讓機器人學會「看準時機」: Google DeepMind 的 Gemini Robotics ER 2

#GoogleDeepMind#GeminiRobotics#具身智能#AI機器人#科技趨勢
【科技時事】讓機器人學會「看準時機」: Google DeepMind 的 Gemini Robotics ER 2

最近看到 Google DeepMind 發表了名為 「Gemini Robotics ER 2」 的具身推理模型(讓AI擁有「大腦」與「身體」的結合能力,讓它能看懂現實環境、思考該做什麼,並指揮機器人動手完成任務)。雖然大家最近可能覺得 Google 在旗艦大模型的進展上稍微慢了一點,但他們在特定領域(如機器人、企業 AI 資源)的迭代其實依然紮實。這則新聞展示了 Google 如何將 AI 的推理能力真正落實到物理世界的移動與操作中。

新聞重點

Gemini Robotics ER 2 被定位為機器人的「高階大腦」。它的核心突破在於將「思考」與「執行」分離:ER 2 負責高階的任務規劃與推理,而具體的馬達動作則交給底層的視覺-語言-動作(VLA)模型。

這款模型有幾個技術亮點:

1. 時間智能(Temporal Intelligence):這讓機器人能精確判斷任務何時完成。例如,它能以 91.3% 的準確度判斷咖啡何時倒滿,且延遲低於一秒。

2. 即時性與工具編排:透過 Gemini Live API,機器人可以一邊執行動作一邊持續思考,減少了過去機器人常見的「停頓思考」現象。

3. 多機器人協作:支援不同類型的機器人(如輪式與人形機器人)協同工作,並能從原始影片串流中偵測執行錯誤。

4. 安全機制:當偵測到人類接近時,模型會主動停止動作,Google 稱其為迄今最安全的模型。

我的觀察

Google 身為科技巨頭,其商業佈局非常深遠,我們外人很難以去猜想他們的下一步策略是什麼。雖然表面上旗艦模型的聲量有起伏,但看看他們在人才與資源上的儲備,若說他們會追趕不上目前前沿的AI模型開發者,那倒還未必,其實目前除了Gemini 的 Pro 系列模型延遲外,他們在這種跨領域的整合(AI + 機器人)一些企業應用等等的方面還是可以常常看到Google耕耘的痕跡。

而這則新聞中最讓我覺得有趣的是這個新發表模型,對「精準度」要求的例子。我們人類覺得把咖啡倒滿或繫好垃圾袋是很簡單很直覺的瑣事,但在機器人領域,單靠影像判斷往往會因為延遲而導致咖啡溢出。ER 2 針對這種關鍵時刻進行預判,大程度上解決了這種人類看似習以為常、但在工程技術上卻是巨大挑戰的問題。

或許有些人可能會覺得這只是一個小小技術門檻,但我認為科技的進步就是靠這些微小的累積。關注這些細節,能讓我們更理解產品開發的真實困境,去理解工程其實並不是這麼簡單,很多時後一個基本的小動作中,或許就隱含著一些工程難題在其中。

這件事值得繼續觀察什麼

1. 具身 AI 的架構標準化:這種「高階大腦(推理)」與「低階執行(動作)」的分工,是否會成為未來機器人開發的主流架構?

2. 多機協作的商業化:當不同形態的機器人(輪式、人形)能透過同一個 AI 腦袋協作,這對自動化倉儲或居家照護的實用性將有大幅提升。

文章圖片

原文連結:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/

Read more

【時事新聞】祖克柏的五年預言:當 AI 從「聊天機器人」變成你的「個人代理人」
[科技時事]2026-07-304 分鐘

【時事新聞】祖克柏的五年預言:當 AI 從「聊天機器人」變成你的「個人代理人」

Meta 執行長祖克柏預測五年內將有數十億人擁有個人 AI 代理人,協助處理財務與健康等事務。本文整理 Meta 財報後討論的相關數據,包括 Reality Labs 的巨額虧損與自由現金流的重挫,並結合作者觀察,探討 AI 如何從「對話工具」轉型為「執行代理人」,以及通訊軟體在 AI 普及化進程中的戰略地位。