7月30日,谷歌正式发布面向机器人的AI模型「GeminiRobotics2」。该模型瞄准机器人全身控制与复杂作业场景,定位为下一代机器人的智能基座。GeminiRobotics2属于视觉-语言-动作(VLA)模型,核心能力是将视觉与语言信息转化为运动指令。设计目标是让机器人理解周围环境,并根据任务目标自主生成动作。传统机器人的老问题,这次想一起解掉传统机器人长期依赖预设作业流程或远程操控。面对动态环境时的自适应能力,以及将学习成果迁移到不同形态机器人上的能力,一直是行业痛点。谷歌此次一口气发布了三款模型,试图正面回应这些难题。GeminiRobotics2负责全身控制--从足尖到指尖。支持人形机器人和双臂机器人,能完成手部或夹爪级别的精细操作。GeminiRoboticsER2承担判断与规划职能,覆盖人机交互、环境感知和多阶段任务规划。本次更新还新增了多机器人协同作业能力。GeminiRoboticsOn-Device2则是部署在机器人本体的VLA模型,无需网络连接即可运行,且声称能在数小时内适配新机器人的形态与传感器配置。全身协调:从走到拧,一条龙GeminiRobotics2在人形机器人全身协同作业上取得突破。以Apptronik的「Apollo2」为例,接收"把水壶放进绿色箱子里"这类指令后,机器人能自主完成行走、搬运、放置的一整套动作链。精细操作层面,搭载5指22自由度SharpaWave手部的Apollo2,完成了系绳子、拉合拉链袋等高难度动作。而在FrankaDuo平台上,双指夹爪也实现了物品归位、工具整理等多步操作。安全性也被提上日程谷歌同时在推进机器人安全能力的提升。GeminiRoboticsER2强化了人体近距检测功能,能够在识别到人员靠近时触发安全处置流程。谷歌将GeminiRobotics2定义为推动机器人从"单一任务自动化"迈向"通用作业能力"的关键基座。