Ai auzit de paradoxul lui Moravec? Paradoxul afirmă că raționamentul avansat necesită foarte puțină putere de calcul pentru un sistem de inteligență artificială (AI), în timp ce implementează abilitățile perceptive-motorii pe care oamenii le asumă, necesită resurse de calcul enorme. În esență, sarcinile logice complexe sunt mai ușoare pentru AI decât sarcinile senzoriale de bază pe care le pot îndeplini instinctele umane. Acest paradox evidențiază diferența dintre AI și abilitățile cognitive umane în această etapă.
Oamenii sunt în mod inerent multimodal. Fiecare dintre noi este ca un terminal inteligent care de obicei trebuie să meargă la școală pentru a fi educat (instruit), dar scopul și rezultatul acelei instruiri și învățării este că avem capacitatea de a lucra și de a trăi autonom, fără a ne baza întotdeauna pe instrucțiuni externe și controla.
Aflăm despre lumea din jurul nostru prin mai multe modalități senzoriale, cum ar fi vedere, vorbire, sunet, atingere, gust și miros pentru a analiza, raționa, decide și lua măsuri.
După ani de fuziune a senzorilor și evoluția AI, roboții sunt în mare parte echipați cu senzori multimodari în această etapă. Pe măsură ce aducem mai multă putere de calcul pe dispozitivele Edge, cum ar fi roboții, aceste dispozitive devin mai inteligente și mai inteligente, capabile să -și simtă împrejurimile, înțelegând și comunicând în limbajul natural, dobândind haptics prin interfețe de detectare digitală, precum și detectarea forței specifice a robotului, Viteza unghiulară și chiar câmpul magnetic din jurul robotului printr -o combinație de accelerometre, giroscopuri și magnetometre și multe altele.
Spre o nouă eră a roboticii și a cogniției mașinii
Înainte de transformator și modele de limbaj mare (LLM), implementarea multimodalității în AI a necesitat de obicei utilizarea mai multor modele separate responsabile pentru diferite tipuri de date (text, imagini, audio) și integrarea diferitelor modalități printr -un proces complex.
Odată cu apariția modelelor de transformare și a LLM -urilor, multimodalitatea a devenit mai integrată, permițând unui singur model să proceseze și să înțeleagă simultan mai multe tipuri de date, rezultând sisteme AI care sunt mai capabile să își simtă în mod cuprinzător mediul. Această schimbare a îmbunătățit foarte mult eficiența și eficacitatea aplicațiilor AI multimodale.
În timp ce LLM-urile precum GPT -3 sunt în primul rând bazate pe text, industria a făcut progrese rapide către multimodalitate. Din clipul lui Openai și Dall-E, iar acum Sora și GPT -4 o, sunt exemple de modele care s-au îndreptat către multimodalitate și interacțiune mai naturală umană-computer. De exemplu, CLIP înțelege imaginile împerecheate cu un limbaj natural, reducând astfel decalajul dintre informațiile vizuale și textuale; Dall-E își propune să genereze imagini bazate pe descrieri textuale. Vedem modelul Google Gemini care suferă o evoluție similară.
În 2024, evoluția multimodală accelerează. În februarie, Openai a lansat Sora, care generează videoclipuri realiste sau imaginative pe baza descrierilor textului. Când vă gândiți la asta, acest lucru ar putea oferi o cale promițătoare pentru a construi simulatoare universale ale lumii sau pentru a deveni un instrument important pentru instruirea roboților. După trei luni, GPT -4 o a îmbunătățit semnificativ performanța interacțiunii om-robot și este capabil să motiveze în timp real între audio, viziune și text. Combinarea informațiilor despre text, vizual și audio pentru a antrena un nou model end-to-end elimină două tranziții modale de la modalitatea de intrare la text și apoi de la modalitate de text la modalitate de ieșire, ceea ce la rândul său îmbunătățește dramatic performanța.
În aceeași săptămână din februarie, Google a lansat Gemini 1.5, ceea ce a extins dramatic lungimea contextului la 1 milion de jetoane. Aceasta înseamnă că 1.5 Pro poate prelucra cantități mari de informații simultan, inclusiv o oră de videoclip, 11 ore de audio și o bază de cod care conține mai mult de 30, 000 linii de cod sau 700, 000 Words.Gemini 1.5 este construit pe liderul de cercetare Google privind transformatorul și arhitectura expertă cu membri mixte (MOE) și modelele deschise de 2B și 7B care pot fi implementate pe partea de margine. În cadrul conferinței Google I/O din mai, pe lângă dublarea duratei contextului și a lansat o serie de instrumente și aplicații AI generative, Google și-a explorat viziunea pentru viitorul Project Astra, un asistent AI de scop general care procesează informații multimodale , înțelege contextul în care este plasat un utilizator și interacționează cu oamenii în conversații într -un mod foarte natural.
În calitate de companie din spatele open-source LLM LLAMA, META se alătură și piesei General Artificial Intelligence (AGI).
Această adevărată multimodalitate crește foarte mult nivelul de inteligență a mașinii și va duce la noi paradigme pentru multe industrii.
De exemplu, roboții erau foarte omogeni, cu unii senzori și capacități de locomoție, dar, în general, nu aveau „creierul” pentru a învăța lucruri noi și pentru a se adapta mediilor nestructurate și necunoscute.
Se preconizează că LLM -urile multimodale vor transforma capacitatea roboților de a analiza, raționa și învăța, mutându -i de la specializare la generalizare. PC-urile, serverele și smartphone-urile sunt lideri în platforme de calcul cu scop general și pot rula multe tipuri diferite de aplicații software pentru a obține o mare varietate de funcții. Generalizarea va ajuta la creșterea creșterii, generarea de economii de scară, iar prețurile pot fi reduse dramatic pe măsură ce acestea se extind, ceea ce duce la un ciclu virtuos de adopție în mai multe domenii.
Elon Musk a observat beneficiile tehnologiei generalizate de la început, pe măsură ce roboții Tesla au evoluat de la Bumblebee în 2022 la Optimus Gen 1, anunțați în martie 2023 și Gen 2, anunțați la sfârșitul anului 2023, cu versatilitate și capacități de învățare în continuă creștere. În trecut 6-12 luni, am asistat la o serie de descoperiri în domeniul roboticii și roboticii umanoide.
Noile tehnologii din spatele roboticii de generație viitoare și inteligența întruchipată
Nu există nicio îndoială că mai avem multă muncă de făcut înainte ca inteligența întruchipată să ajungă la producția în masă. Avem nevoie de proiecte mai ușoare, de rulaje mai lungi și de platforme mai rapide, mai puternice de calcul pentru a prelucra și concura informațiile despre datele senzorului pentru a lua decizii în timp util și acțiuni de control.
Și ne îndreptăm spre crearea de roboți umanoizi; Mii de ani de civilizație umană au produs medii omniprezente concepute pentru oameni, iar sistemele robotizate umanoide sunt așteptate să poată interacționa confortabil cu oamenii și cu mediul înconjurător și să efectueze operațiuni necesare în medii care pot fi existante, datorită asemănării lor în formă cu oamenii. Aceste sisteme vor fi bine potrivite pentru a gestiona sarcini murdare, periculoase și plictisitoare, cum ar fi îngrijirea pacientului și reabilitarea, munca de serviciu în industria ospitalității, ajutoarele didactice sau însoțitorii de învățare în domeniul educațional și sarcini periculoase, cum ar fi răspunsul la dezastre și manipularea materialelor periculoase . Astfel de aplicații utilizează atributele umane umanoide pentru a facilita interacțiunile naturale de robot uman, pentru a acționa în spațiile centrate pe om și pentru a îndeplini sarcini care sunt adesea dificile de îndeplinit roboții tradiționali.
Multe companii de AI și robotică lansează noi cercetări și colaborare în ceea ce privește modul de a instrui roboți pentru a face mai bine motive și planificare în noi medii nestructurate. Ca noua „creier” de roboți, modelele care sunt instruite în prealabil pe cantități mari de date au capacități de generalizare excelente, permițând roboților să-și vadă și să înțeleagă mediile lor mai cuprinzător, să își ajusteze mișcările și acțiunile bazate pe feedback senzorial și să-și optimizeze performanța Într -o varietate de medii dinamice.
Ca un exemplu interesant, câinele robot al lui Boston Dynamics, Spot, poate acționa ca un ghid turistic într -un muzeu, interacționând cu vizitatorii, introducându -i la diferitele exponate și răspunzând la întrebările lor. Poate fi greu de crezut, dar în acest caz de utilizare, performanțele distractive, interactive și subtile ale Spot sunt mai importante decât să te asiguri că faptele sunt corecte.
Transformator de robotică: noul creier al roboticii
Robotics Transformer (RT) evoluează rapid pentru a traduce intrările multimodale direct în cod acționabil. RT -2 Google DeepMind îndeplinește, precum și predecesorul său, RT -1, cu o rată de succes de aproape 100% atunci când efectuați sarcini care au fost văzute anterior. Cu toate acestea, atunci când este instruit cu Palm-E (un model de limbaj multimodal încorporat orientat către robot) și Pali-X (un model de viziune și limbaj multilingv pe scară largă, nu este conceput special pentru roboți), RT -2 are capacități de generalizare mai bune și depășește rt -1 pe sarcini nevăzute.
Microsoft a introdus LLAVA, un limbaj pe scară largă și asistent de viziune. Proiectat inițial pentru sarcini bazate pe text, LLAVA folosește puterea GPT -4 pentru a crea o nouă paradigmă pentru instrucțiunile multimodale pentru a urmări datele, integrarea perfectă a componentelor textuale și vizuale, care pot fi utile pentru sarcini robotice. La introducerea sa, LLAVA a stabilit noi înregistrări pentru chat -ul multimodal și sarcinile de întrerupere științifică, depășind deja capacitățile medii umane.
Așa cum am menționat anterior, incursiunea Tesla în Humanoid și AI Robotics cu scop general este semnificativă nu numai pentru că este proiectată pentru producția de scară și în masă, ci și pentru că Fundația tehnologică puternică pe deplin auto-conducere (FSD) a Tesla AughT pentru automobile poate fi utilizată pentru roboți. Tesla are, de asemenea, o carcasă inteligentă de utilizare a producției pentru aplicarea Optimus la noul său proces de producție a vehiculelor energetice.
Brațul este piatra de temelie a viitorului roboticii
ARM consideră că creierul robotizat, atât „creierul mare”, cât și „micul creier”, ar trebui să fie un sistem eterogen de calcul AI care oferă performanțe superioare, răspuns în timp real și eficiență energetică.

Robotica implică o gamă largă de sarcini, inclusiv calcul de bază (de exemplu, trimiterea și primirea semnalelor către și de la motoare), procesarea avansată a datelor (de exemplu, interpretarea datelor de imagine și senzor) și rularea LLM -urilor multimodale menționate anterior. CPU este potrivit pentru sarcini cu scop general, în timp ce pedalele de gaz AI și GPU-urile pot gestiona mai eficient sarcinile de procesare paralelă, cum ar fi învățarea automată (ML) și procesarea grafică. Pedale suplimentare de gaz, cum ar fi procesoare de semnal de imagine și codecuri video pot fi, de asemenea, integrate pentru a îmbunătăți capacitățile de viziune ale robotului și eficiența de stocare/transmisie. În plus, CPU ar trebui să aibă o reacție în timp real și trebuie să poată rula sisteme de operare, cum ar fi pachetele Linux și ROS.
Atunci când este extins la stiva de software robotizat, stratul de sistem de operare poate necesita, de asemenea, un sistem de operare în timp real (RTOS) care să poată gestiona în mod fiabil sarcinile critice în timp, precum și o distribuție Linux personalizată pentru robotică, cum ar fi ROS, care poate oferi Servicii concepute pentru clustere de calcul eterogene. Considerăm că standardele și programele de certificare sponsorizate de ARM, cum ar fi SystemReady și PSA Certified, vor ajuta la extinderea dezvoltării software-ului robotizat. SystemReady este conceput pentru a se asigura că distribuțiile standard de sisteme de operare bogate se desfășoară pe o gamă largă de syste-on-chips (SOCS) pe baza arhitecturii ARM, în timp ce certificarea PSA ajută la simplificarea soluțiilor de implementare a securității pentru a îndeplini cerințele regionale de securitate și reglementare pentru dispozitivele conectate.
Progrese în modele multimodale pe scară largă și AI generative au prezentat o nouă eră în dezvoltarea roboților AI și a roboților umanoizi. Alături de calculul AI și ecosistemele, eficiența energetică, securitatea și siguranța funcțională sunt esențiale pentru a face robotica în această nouă eră. Procesoarele ARM sunt deja utilizate pe scară largă în robotică și așteptăm cu nerăbdare să lucrăm îndeaproape cu ecosistemul pentru a face din braț o piatră de temelie a viitorului roboticii AI.




