器人之腦”:Gemini Robotics ER 2與“物理AGI”的進(jìn)擊)
2026年7月30日Google DeepMind正式發(fā)布Gemini Robotics ER 2模型。官方博客用一句話(huà)概括了它的定位——“一個(gè)高級(jí)大腦”。同一天谷歌在社交平臺(tái)X上拋出了更直白的九個(gè)字“一個(gè)大腦。適用于任何機(jī)器人。”當(dāng)特斯拉、Figure AI等玩家在機(jī)器人本體賽道上競(jìng)速時(shí)谷歌選擇了一條截然不同的路徑不造機(jī)器人只造機(jī)器人的“大腦”。Gemini Robotics ER 2的發(fā)布標(biāo)志著這場(chǎng)“物理AGI”競(jìng)賽進(jìn)入了一個(gè)全新的階段。一、三層架構(gòu)讓機(jī)器人“思考”與“行動(dòng)”分離Gemini Robotics 2并非單一模型而是一個(gè)由三個(gè)模型組成的分層系統(tǒng)。第一層是Gemini Robotics 2——視覺(jué)-語(yǔ)言-動(dòng)作模型VLA將攝像頭畫(huà)面和自然語(yǔ)言指令直接轉(zhuǎn)換為電機(jī)控制指令能夠控制整個(gè)人形機(jī)器人從腳到指尖的每一個(gè)關(guān)節(jié)。與此前主要控制機(jī)器人上半身的模型不同Gemini Robotics 2實(shí)現(xiàn)了真正意義上的“全身控制”——機(jī)器人可以行走、下蹲、伸展、抓取完成“穿過(guò)房間、拿起灑水壺并將其放到架子上”這樣需要全身協(xié)調(diào)的完整任務(wù)。第二層是Gemini Robotics ER 2——具身推理模型也就是本次發(fā)布的核心。它不直接控制電機(jī)而是充當(dāng)機(jī)器人的“高級(jí)大腦”理解物理環(huán)境、規(guī)劃多步驟任務(wù)然后將執(zhí)行指令交給底層的VLA模型。官方演示中ER 2驅(qū)動(dòng)Boston Dynamics的Spot機(jī)器人僅憑語(yǔ)音指令即可完成導(dǎo)航和物體抓取。第三層是Gemini Robotics On-Device 2——輕量級(jí)VLA模型經(jīng)過(guò)優(yōu)化可在機(jī)器人本地運(yùn)行只需幾小時(shí)數(shù)據(jù)就能適配全新的機(jī)器人本體。三層各司其職動(dòng)作、規(guī)劃、部署——這個(gè)架構(gòu)本身就是谷歌的競(jìng)爭(zhēng)宣言。二、連續(xù)視頻理解從“停-想-動(dòng)”到“邊想邊動(dòng)”Gemini Robotics ER 2相比前代ER 1.6的核心突破在于連續(xù)視頻流處理能力。傳統(tǒng)機(jī)器人推理模型采用“停-想-動(dòng)”模式——機(jī)器人必須先停下來(lái)思考再執(zhí)行動(dòng)作再停下來(lái)思考下一步。這種模式在物理世界中造成了明顯的卡頓和不自然。ER 2通過(guò)接入Gemini Live API的雙向流式端點(diǎn)實(shí)現(xiàn)了同步推理——機(jī)器人在執(zhí)行當(dāng)前動(dòng)作的同時(shí)已經(jīng)在規(guī)劃后續(xù)步驟。在性能數(shù)據(jù)上ER 2交出了一份扎實(shí)的答卷任務(wù)進(jìn)度分類(lèi)準(zhǔn)確率達(dá)57.4%幫助機(jī)器人在不重啟整個(gè)工作流的情況下修正失敗步驟關(guān)鍵時(shí)刻定位準(zhǔn)確率達(dá)91.3%平均時(shí)間誤差僅0.96秒——比如判斷“何時(shí)停止向杯中倒咖啡”執(zhí)行速度是ER 1.6的4倍滿(mǎn)足現(xiàn)實(shí)機(jī)器人安全運(yùn)行所需的亞秒級(jí)延遲要求128,000 Token的上下文窗口足以處理數(shù)分鐘連續(xù)視頻流更值得注意的是ER 2可以原生調(diào)用Google Search或開(kāi)發(fā)者自定義函數(shù)。這意味著機(jī)器人遇到不確定的情況時(shí)可以直接“上網(wǎng)查”——這是具身智能走向?qū)嵱没年P(guān)鍵一步。三、多機(jī)器人協(xié)作第一次讓不同的“身體”共享同一個(gè)“大腦”Gemini Robotics ER 2首次引入了多機(jī)器人協(xié)作機(jī)制。在官方演示中Apptronik公司的Apollo 2人形機(jī)器人與Franka F3 Duo機(jī)械臂平臺(tái)成功展示了跨設(shè)備協(xié)同作業(yè)。不同類(lèi)型的機(jī)器人借助ER 2提供的共享語(yǔ)義理解可以實(shí)時(shí)溝通、分工配合、交接任務(wù)完成單臺(tái)設(shè)備無(wú)法獨(dú)立完成的復(fù)雜工作流。這一能力的意義遠(yuǎn)超技術(shù)演示本身。它揭示了一個(gè)趨勢(shì)未來(lái)的機(jī)器人生態(tài)可能不是“一個(gè)機(jī)器人干所有事”而是“一群各有所長(zhǎng)的機(jī)器人共享同一個(gè)智能系統(tǒng)協(xié)同作戰(zhàn)”。而谷歌想要的正是這個(gè)“共享的智能系統(tǒng)”。四、安全從“可選項(xiàng)”到“必答題”當(dāng)AI模型開(kāi)始控制物理世界中的人形機(jī)器人時(shí)安全不再是錦上添花而是生死攸關(guān)。谷歌在ER 2上采取了多層次安全防護(hù)策略。ER 2被官方稱(chēng)為“迄今為止最安全的機(jī)器人模型”——它能更好地檢測(cè)人類(lèi)是否靠近觸發(fā)安全工具調(diào)用并在有人過(guò)于接近時(shí)將機(jī)器人帶至安全停止?fàn)顟B(tài)。谷歌還推出了名為ASIMOV-Agentic的安全評(píng)測(cè)基準(zhǔn)專(zhuān)門(mén)測(cè)試推理模型作為“編排者”時(shí)是否安全——能否拒絕不安全的工具調(diào)用、判斷物理可行性、在不確定時(shí)尋求人類(lèi)幫助。不過(guò)谷歌在模型卡中明確禁止開(kāi)發(fā)者將機(jī)器人模型用于醫(yī)療和交通運(yùn)輸?shù)劝踩P(guān)鍵領(lǐng)域。這說(shuō)明即便技術(shù)突飛猛進(jìn)“物理AGI”距離真正進(jìn)入高風(fēng)險(xiǎn)場(chǎng)景仍有距離。五、行業(yè)變局谷歌押注“Android時(shí)刻”Gemini Robotics ER 2的發(fā)布本質(zhì)上是谷歌對(duì)整個(gè)機(jī)器人行業(yè)的一次戰(zhàn)略卡位。當(dāng)前人形機(jī)器人賽道的主流玩家——特斯拉、Figure AI——走的是垂直整合路線(xiàn)自研模型、自研執(zhí)行器、自建工廠(chǎng)。而谷歌的選擇截然相反做一個(gè)開(kāi)放的、適用于任何機(jī)器人的智能層。DeepMind負(fù)責(zé)人Demis Hassabis曾表示他希望為機(jī)器人構(gòu)建一個(gè)類(lèi)似Android的操作系統(tǒng)。如果這一愿景實(shí)現(xiàn)任何機(jī)器人硬件廠(chǎng)商都可以搭載谷歌的“大腦”就像任何手機(jī)廠(chǎng)商都可以搭載Android一樣。谷歌不參與機(jī)器人本體的制造競(jìng)賽卻可能成為所有機(jī)器人背后的平臺(tái)級(jí)贏家。在商業(yè)落地層面ER 2已通過(guò)Gemini API和Google AI Studio向開(kāi)發(fā)者公開(kāi)提供并在Gemini企業(yè)智能體平臺(tái)開(kāi)啟私密預(yù)覽。首批合作伙伴包括Apptronik、Agile Robots SE、Boston Dynamics等。第一波應(yīng)用場(chǎng)景將集中在倉(cāng)庫(kù)分揀、設(shè)施巡檢、實(shí)驗(yàn)室任務(wù)等風(fēng)險(xiǎn)相對(duì)可控的領(lǐng)域。 結(jié)語(yǔ)Gemini Robotics ER 2的發(fā)布標(biāo)志著具身智能從“實(shí)驗(yàn)室玩具”向“可部署系統(tǒng)”邁出了實(shí)質(zhì)性的一步。連續(xù)視頻理解、同步推理、多機(jī)器人協(xié)作、工具調(diào)用——這些能力疊加在一起正在將一個(gè)曾經(jīng)只存在于科幻中的概念變成現(xiàn)實(shí)一個(gè)能看、能想、能規(guī)劃、能協(xié)作的機(jī)器人“大腦”。谷歌不造機(jī)器人但谷歌想成為所有機(jī)器人的“大腦”。這條路能否走通尚需時(shí)間檢驗(yàn)但有一點(diǎn)已經(jīng)清晰物理世界與AI的交匯正在以前所未有的速度加速。而當(dāng)這場(chǎng)加速發(fā)生時(shí)誰(shuí)掌握了“大腦”誰(shuí)就掌握了主動(dòng)權(quán)。