Un nuevo truco permite adentrarse en el razonamiento oculto de Claude, ChatGPT y Gemini


Panfilov y sus colegas descubrieron que al introducir rastros de razonamiento cifrados en una versión reducida del mismo modelo, se puede revelar el razonamiento oculto en su interior. Los modelos más pequeños han recibido menos entrenamiento de alineación, lo que significa que, a diferencia de los más grandes, es menos probable que se nieguen a revelar sus pensamientos internos.

«La idea de sustituir los mensajes por una versión menos robusta del modelo, que conserve la misma clave de descifrado pero tenga una alineación más limitada, resulta muy inquietante. Sin duda, se está convirtiendo en un problema», afirma Florian Tramer, informático de la ETH Zúrich en Suiza, especializado en seguridad informática.

El mismo método también reveló información secreta, incluidas claves API y contraseñas, incrustadas en los rastros de razonamiento capturados desde la máquina de un usuario.

Panfilov y sus coautores alertaron a OpenAI, Anthropic y Google sobre la vulnerabilidad el mes pasado. Cada empresa ha ajustado su API para mitigar el problema. Si bien ya no es posible extraer información privada de esta manera, Panfilov afirma que aún se pueden descubrir algunos rastros de razonamiento utilizando el mismo método. Corregir completamente el proceso de destilación requeriría una revisión fundamental del funcionamiento de las API de estas empresas, explica.

«Valoramos la investigación independiente sobre nuestros modelos y hemos comenzado a implementar medidas de mitigación a corto plazo para los comportamientos de repetición descritos en el informe», afirma Michael Aciman, portavoz de Anthropic. Añade que la investigación no implicó la recuperación de claves de cifrado, el acceso a la infraestructura de Anthropic ni la recuperación de datos personales de sus sistemas.

Google y OpenAI se negaron a hacer comentarios.

Imagen conceptual de un humano sosteniendo una pieza de rompecabezas y una mano robótica al lado.

Ahora que tantas noticias y servicios relacionados con la IA están en boca de todos, ¿hay algún término que aún no entiendas del todo? WIRED compila 33 palabras clave que conviene conocer.

La destilación de IA se convierte un frente entre EE UU y China

La destilación se ha convertido en un tema de importancia geopolítica en los últimos meses, a medida que empresas estadounidenses y chinas compiten por la supremacía en IA con modelos cada vez más potentes. Los sectores más intransigentes de China afirman que el país obtiene una ventaja estratégica al destilar la tecnología estadounidense para construir modelos de ponderación abierta que resultan menos costosos de ejecutar.

Otros, sin embargo, argumentan que la destilación es una forma muy utilizada de potenciar rápidamente las capacidades de un modelo de IA en ciertas áreas. Mark Zuckerberg, CEO de Meta, afirmó en una publicación de blog que la destilación «es un principio importante del funcionamiento del ecosistema de código abierto» y advirtió que restringir esta práctica pondría a Estados Unidos en desventaja.

Kyle Miller, investigador del Centro para la Seguridad y las Tecnologías Emergentes (CSET), un centro de estudios sobre políticas tecnológicas, afirma que no está claro hasta qué punto la destilación beneficia realmente a China. Esto se debe a que solo mejora las capacidades de los modelos existentes de forma limitada, y a que las empresas chinas parecen tener la experiencia necesaria para desarrollar modelos de vanguardia desde cero si fuera necesario. «En Estados Unidos, nadie sabe hasta qué punto la destilación beneficia a los laboratorios chinos. En mi opinión, si se les prohibiera destilar, el panorama competitivo no cambiaría drásticamente», declara Miller.

Previous Gobierno dominicano habilita centro de acopio en apoyo a Colombia
Next “Un pueblo golpeado por la falta de Estado”: Chocó, el epicentro de un sismo y de una deuda histórica en Colombia