Aditya Ramabadran, Simon Mahns y Tobias Gessler, tres ingenieros de IA de una startup llamada Axiom, tuvieron hace poco ganas de comer en In-N-Out Burger. Sin embargo, no tenían intención de conducir ellos mismos.
Sentados en un Toyota Corolla de 2024 cerca del drive-thru del restaurante de la zona de la Bahía, abrieron una laptop y le pidieron a GPT-6 Astra, de OpenAI, que se pusiera al volante. Conectaron una interfaz de chat a un servidor, que a su vez estaba conectado a varias cámaras montadas en el parabrisas y al sistema de dirección asistida del auto. Un conductor de seguridad mantuvo un pie sobre el freno, por si acaso.
El modelo de IA, que normalmente se encarga de generar texto, código y alguna que otra imagen, condujo el vehículo de forma lenta pero segura hasta la ventanilla para que pudieran recoger su comida.
«Quizá la inteligencia artificial general (IAG) ya esté aquí, después de todo», comentó uno de los ingenieros, refiriéndose a la idea tan popular de máquinas capaces de igualar la inteligencia humana.
Los vehículos autónomos no son nada nuevo, pero normalmente los controlan algoritmos entrenados y diseñados específicamente para esa tarea. En este caso, la operación partió de un modelo diseñado para generar texto, y se llevó a cabo sobre la marcha, sin ningún tipo de entrenamiento previo por parte del trío. Esta hazaña en el restaurante de comida rápida, así como otros experimentos, sugieren que los modelos de IA basados en el lenguaje están empezando a adquirir una comprensión rudimentaria, pero útil, del mundo físico.
Aunque durante el paseo del trío no ocurrió nada especialmente alarmante, admiten que poner un modelo de propósito general al mando de un bloque de acero de dos toneladas que se mueve a gran velocidad es una tarea de alto riesgo. A medida que mejore nuestra comprensión de la física, podríamos ver cómo los modelos de IA se integran en el mundo real de maneras nuevas, impresionantes y quizás peligrosas.
La dimensión física
Los modelos más inteligentes de hoy en día son muy buenos respondiendo a preguntas complejas e incluso realizando algunas tareas virtuales de forma autónoma, pero sus habilidades tienden a limitarse al mundo de las computadoras conectadas a internet. Si llevamos estos modelos al mundo real, enseguida se quedan desconcertados. A pesar de las afirmaciones de que la IAG ya está aquí, las empresas de IA ven claramente el razonamiento físico como una frontera aún por conquistar.
Algunos investigadores han dejado las grandes empresas para fundar startups centradas en resolver el razonamiento físico. Andrew Dai, CEOa de una de estas empresas, llamada Elorian AI, trabajó anteriormente como investigador en Google DeepMind. Afirma que un mejor razonamiento visual abrirá las puertas a muchas nuevas aplicaciones para la IA, como sistemas que entiendan si los comensales están disfrutando de su comida en un restaurante o robots capaces de funcionar en un hogar. Dai afirma que la robótica es un caso de prueba crucial para las habilidades de razonamiento físico: «Es esencial, no se puede imaginar la robótica doméstica sin esto».
Elorian y Scale AI, una empresa que proporciona datos de entrenamiento a los grandes laboratorios de IA, han desarrollado un nuevo punto de referencia, «Humanity’s Sixth Sense», que mide la capacidad de los modelos para comprender escenas físicas.
«La mayor parte de la investigación en IA visual se centra en la percepción. Queríamos preguntarnos qué se necesitaría realmente para que un modelo comprendiera una escena de forma intuitiva, tal y como lo hace una persona sin pensarlo», explica Xingang Guo, investigador científico de Scale AI que participó en el desarrollo del punto de referencia.

