जो संख्या मायने रखती है वह है 22: पाँच-उंगली वाले SharpaWave hand के degrees of freedom, जिसे Google का नया robotics model अब पूरे humanoid शरीर पर चला सकता है। 30 जुलाई को प्रकाशित दो blog posts में Google DeepMind ने Gemini Robotics 2 पेश किया, पहला ऐसा vision-language-action model जो पूरे humanoid को नियंत्रित करता है, उसके अपने शब्दों में 'पैरों से उंगलियों के सिरे तक', जहाँ पिछले versions सिर्फ़ tabletop upper-body tasks तक सीमित थे। Apptronik के Apollo 2 पर दिखाए गए demo में robot मेज़ तक चलता है, watering can पकड़ता है, उसे कमरे के पार ले जाकर shelf पर रखता है, फिर articulated hand से knots बांधता है और ziplock bag सील करता है; एक Franka Duo platform दो-उंगली की grippers से tight packing करता है।
दूसरा model वही है जिसे builders सचमुच छू सकते हैं। Gemini Robotics ER 2 planning brain है: वह कई मिनट चलने वाले multi-step tasks को जोड़ता है, जिनमें Google के मुताबिक़ सैकड़ों decisions होते हैं, असफल steps खुद सुधारता है, Google Search जैसे tools को natively बुलाता है, और bidirectional streaming के लिए Gemini Live API से जुड़ता है। यह आज से Gemini API और Google AI Studio के ज़रिए सार्वजनिक रूप से उपलब्ध है, और Gemini Enterprise Agent Platform पर private preview में है। Google की अपनी evals में दावा है कि progress classification में 57.4% सटीकता, moment-finding में 91.3% सटीकता और 0.96 सेकंड की mean absolute distance, बहुत बड़े models से चार गुना execution speed, और यह digital displays से लेकर liquid thermometers तक 10 प्रकार के instruments पढ़ता है।
तीसरा model, Gemini Robotics On-Device 2, locally चलता है और Google के मुताबिक़ बिल्कुल नए robot bodies से कुछ घंटों में ढल जाता है, आमतौर पर 200 से कम examples के साथ, Dexmate, SO101 और Trossen hardware पर दिखाया गया। Multi-robot demos में Apollo 2 को Franka F3 Duo के साथ जोड़ा गया, और एक अलग demo में ER 2 Boston Dynamics के Spot की APIs को orchestrate करके voice command पर snack लाता है, code GitHub पर है। नामित partners हैं Apptronik, Boston Dynamics और Agile Robots। Safety में Google ने unsafe tool calls और human intervention के लिए नया ASIMOV-Agentic benchmark प्रकाशित किया, और कहती है कि कोई व्यक्ति पास आने पर ER 2 humanoid को रोक देता है और रास्ता साफ़ होने पर फिर चलाता है।
आग्रहें संरचनात्मक हैं। ऊपर दिया हर benchmark Google की अपनी evaluation है, और पत्रकारों को दिखाए गए demonstrations, WIRED समेत, pre-recorded video थे, live runs नहीं। Availability का बँटवारा भी घोषणा को असली आकार देता है: तीनों models में से सिर्फ़ ER 2 सार्वजनिक रूप से उपलब्ध है, जबकि Robotics 2 और On-Device 2 early-access partners तक सीमित हैं। DeepMind की robotics head Carolina Parada इस release को 'physical AGI' की ओर मील का पत्थर कहती हैं। शांत पढ़ाई builders के लिए ज़्यादा काम की है: robot control उसी API bill की एक line बनता जा रहा है जिसमें text generation है, और खुला सवाल 'क्या model हाथ हिला सकता है' से खिसककर 'किसे चलाने की इजाज़त है, और किस safety case के तहत' हो रहा है।
