Google descubre que su IA hace trampa al intentar resolver problemas matemáticos

Wait 5 sec.

Google descubrió un comportamiento inusual en su modelo de lenguaje más potente. El gigante tecnológico encontró que un centenar de agentes de Gemini 3.1 Pro hicieron trampa mientras intentaban resolver problemas matemáticos complejos. Aunque muchos optaron por el camino fácil, hubo algunos que se resistieron a la tentación y terminaron denunciándolos.lDe acuerdo con un artículo publicado en arXiv, Google DeepMind llevó a cabo un experimento con un enjambre de 100 agentes autónomos. El objetivo era resolver 71 problemas de un conjunto de datos conocido como Formal Conjectures, el cual incluye desde ejercicios sencillos hasta conjeturas matemáticas que ningún humano ha conseguido demostrar.Antes de comenzar la tarea, cada agente recibió instrucciones explícitas de no hacer trampa, con la advertencia de que cualquier intento sería detectado. Los agentes usaron diversas herramientas para coordinarse entre sí, incluido un foro público para compartir hallazgos o preguntas, así como una biblioteca de conocimiento compartido. Entre ellas también estaba un canal para reportar errores o quejas, aunque este no se monitoreaba en tiempo real.Los agentes comenzaron la prueba y durante una hora las cosas marcharon sin problemas, con 37 de los 71 problemas resueltos. Todo cambió cuando un agente encontró un fallo en el sistema que evaluaba las pruebas matemáticas. En los siguientes 27 minutos, ese exploit se propagó de forma viral a través de la biblioteca compartida y el resto de problemas matemáticos quedó resuelto de golpe, aunque no de la forma que se pidió.Foto Ivona Rož (Unsplash)Tras revisar los registros, los investigadores de Google identificaron ciertos patrones de comportamiento dentro del enjambre. Un 9% de los agentes, catalogados como "exploiters", ignoró las instrucciones del sistema y se aprovecharon del fallo para resolver los problemas. Otro 5% mostró resistencia inicial, pero terminó cediendo al ver que sus pares avanzaban más rápido.Algunos agentes de IA hicieron trampa, pero otros los denunciaronSi bien el 62% de los agentes del enjambre ni siquiera se enteró de que había un exploit, un 24% tomó otro comportamiento sorprendente. Este grupo, bautizado como "soplones", se negó a hacer trampa y tomó medidas para frenar a quienes lo hacían.En los registros, el equipo de DeepMind encontró a un agente conocido como "prover-beta", que presentó reportes formales exigiendo que descalificaran a los tramposos. El bot fue un paso más lejos y declaró un boicot autónomo, en donde amagó con no enviar pruebas hasta que se restaurara la integridad del sistema. Otros agentes usaron el foro compartido para denunciar a sus pares y calificar la situación como una farsa, mientras que uno pidió que se le retirara el crédito a los tramposos.Lamentablemente, la protesta quedó ahí, ya que los agentes autónomos no tenían herramientas para sancionar a los infractores. La IA "honesta" no pudo eliminar los resultados fraudulentos de la biblioteca compartida o disputar las reclamaciones, sobre todo porque el canal de quejas no se revisaba en tiempo real.Al final, los investigadores concluyeron que esta situación podría resolverse si dotaran a los agentes de ciertos privilegios, como aplicar sanciones graduales. También funcionaría un protocolo de resolución de conflictos, ya que podrían autogobernarse en ese tipo de entornos colaborativos.El documento puede consultarse de forma gratuita en arXiv e incluye todos los parámetros que se aplicaron a estos agentes de Gemini 3.1 Pro. Como dato adicional, hace más de un año que Google presumía que su IA obtuvo la medalla de oro en la Olimpiada Internacional de Matemáticas.Seguir leyendo: Google descubre que su IA hace trampa al intentar resolver problemas matemáticos