Los modelos de lenguaje han convertido la inteligencia artificial (IA) en algo cotidiano. Cada vez hay más y hacen más cosas. Es más difícil averiguar cuál funciona mejor para según qué tareas. Un nuevo artículo en la revista Science de científicos de Princeton, el MIT, Cambridge y Google DeepMind sugiere nuevas maneras de medir las mejores IA, dejando atrás el viejo test de Turing y los recientes rankings: “La respuesta a la pregunta original de Turing [¿puede una máquina pasar por un humano?] ya se ha contestado, en afirmativo”, dice José Hernández-Orallo, autor principal del artículo, director de investigación del Centro Leverhulme de la Universidad de Cambridge y catedrático de la Universidad Politécnica de Valencia. “Y la evaluación basada en hitos [benchmarks] convierte la IA en una carrera para maximizar indicadores”.Seguir leyendo