Google DeepMind 近日推出了全新的「embodied reasoning」(具身推理)模型 Gemini Robotics ER 2,這項技術旨在解決現有機器人在真實物理世界中的局限,提升其空間與影片理解能力,並實現即時決策與多機器人協作,為實體 AI 的應用開創新局面。
即時決策與多機器人協作
Gemini Robotics ER 2 被定位為機器人的「高階大腦」,專門負責對話、理解物理世界以及規劃多步驟任務,而低階的動作執行則交由視覺-語言-動作(VLA)模型處理。新一代模型整合了 Gemini Live API,透過雙向串流端點大幅降低延遲,使機器人能夠在執行動作的同時同步進行思考,擺脫過去常見的「停頓與思考」延遲感。
各方反應
Google DeepMind 表示,Gemini Robotics ER 2 的推出將大幅提升機器人在日常環境中的應用,使其不僅能精準定位,更能快速反應、掌握時機。此外,Google DeepMind 也與波士頓動力(Boston Dynamics)合作,展示了 Gemini Robotics ER 2 在 Spot 機器人上的應用,成功完成了拿取爆米花等互動任務。
波士頓動力 的 CEO Marc Raibert 表示,這項技術的突破意味著機器人將更加靈活和智能,能夠在複雜環境中自主完成多種任務,大幅提升工作效率。
背景補充
Gemini Robotics ER 2 在影片理解與進度追蹤上有顯著躍升,帶來兩大核心能力:連續進度分類和精準時刻尋找。前者通過分析影片畫面的五個階段(0% 至 100%),讓機器人擁有即時的現場情境意識,能在發生失誤時即時調整或重試,無須重啟整個工作流程。後者則能以高達 91.3% 的準確度和極低的時間誤差(0.96 秒平均絕對距離),精準鎖定關鍵事件發生的影格,確保操作安全。
此外,Gemini Robotics ER 2 支援多機器人協作,讓不同型態的機器人(如輪式機器人與雙足人形機器人)通過共用的語意理解互相交接並完成複雜任務。在安全性方面,新模型在「安全指令遵循」與「人類鄰近度」評測中表現優異,當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
從產業面來看,Gemini Robotics ER 2 的推出不僅代表著機器人技術的重大突破,更預示著未來機器人將更加融入人類生活,成為日常生活中的得力助手。這項技術的普及將推動各行業的智能化轉型,尤其是在製造業、服務業等領域,有望帶來革命性的變化。
目前,Gemini Robotics ER 2 已通過 Gemini API 與 Google AI Studio 向開發者全面開放,並在 Gemini Enterprise Agent Platform 提供私人預覽。如果你是開發者或企業主,不妨考慮如何利用這項技術,為你的業務帶來更多可能性。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Gemini Robotics ER 2 是什麼?
Gemini Robotics ER 2 是 Google DeepMind 推出的一個「具身推理」模型,旨在提升機器人在真實物理世界中的理解能力、即時決策能力和多機器人協作能力。
Gemini Robotics ER 2 有哪些核心能力?
Gemini Robotics ER 2 的核心能力包括連續進度分類和精準時刻尋找,這些能力使其能夠更好地理解物理世界並精確執行任務。
Gemini Robotics ER 2 如何提高安全性?
Gemini Robotics ER 2 在「安全指令遵循」和「人類鄰近度」評測中表現優異,當偵測到人類靠近時,人形機器人能夠自動暫停,並在區域安全後自動恢復作業,大幅提升人機協作的安全性。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。