Tecnología

¿Puede una inteligencia artificial mejorarse a sí misma? Un experimento revela qué le falta todavía

today4 octubre, 2026

share close

La posibilidad de que una IA pueda investigar, desarrollar una versión superior de sí misma y repetir el proceso alimenta algunas de las predicciones más ambiciosas sobre el futuro de esta tecnología. Un nuevo experimento encontró, sin embargo, una limitación fundamental: los agentes actuales pueden realizar buena parte del trabajo técnico de un investigador, pero todavía tienen dificultades para decidir qué ideas son realmente buenas.

Existe una idea que aparece cada vez con mayor frecuencia cuando se habla del futuro de la inteligencia artificial.

¿Qué ocurriría si una IA pudiera comenzar a desarrollar mejores sistemas de inteligencia artificial?

Y si esa nueva generación fuera todavía más capaz, ¿podría desarrollar otra superior?

El proceso podría repetirse una y otra vez.

El concepto se denomina mejora recursiva de la inteligencia artificial y constituye una de las hipótesis más importantes —y también más discutidas— sobre el futuro de esta tecnología.

Algunas compañías creen que los primeros pasos hacia ese escenario ya están comenzando.

Pero un nuevo experimento muestra que todavía existe una diferencia considerable entre automatizar el trabajo técnico de una investigación y realizar verdadera investigación científica de manera autónoma.

Una IA investigando inteligencia artificial

Un grupo de investigadores encabezado por Peter Kirgis y Sayash Kapoor, de la Universidad de Princeton, intentó comprobar hasta dónde pueden llegar actualmente los agentes de IA cuando reciben un problema científico abierto.

No se trataba simplemente de resolver una ecuación, escribir determinado programa o superar una prueba donde existe una respuesta correcta conocida de antemano.

El desafío era mucho más parecido al trabajo de un científico.

La inteligencia artificial debía investigar una pregunta cuya respuesta no conocía.

Para evaluarla, los investigadores desarrollaron un método denominado “shadow evaluation”, o evaluación en la sombra.

Tomaron preguntas procedentes de trabajos científicos de alta calidad que todavía no habían sido publicados y se las entregaron a un agente de inteligencia artificial.

De esa manera podían comparar posteriormente qué había descubierto la IA con el trabajo realizado independientemente por investigadores humanos.

Seis días para escribir un paper

El experimento le dio al agente recursos considerables.

Dispuso de seis días, acceso a Internet, computadoras virtuales, capacidad de procesamiento mediante GPU y alrededor de 3.000 dólares en créditos para utilizar modelos de inteligencia artificial.

El sistema debía producir un trabajo científico con calidad suficiente para aspirar a ser aceptado en una conferencia importante de aprendizaje automático.

Y consiguió hacer muchas cosas sorprendentemente bien.

Buscó bibliografía científica.

Escribió código.

Diseñó y ejecutó cientos de experimentos.

Procesó resultados.

Y finalmente redactó trabajos completos.

Desde el punto de vista de la ingeniería, el desempeño fue notable.

El problema apareció en otro lugar.

Hacer experimentos no es lo mismo que investigar

Los trabajos producidos por los agentes fueron posteriormente evaluados como si se tratara de investigaciones reales.

Y no alcanzaron el nivel necesario.

Según los investigadores, los sistemas demostraron importantes dificultades para realizar la parte verdaderamente abierta del proceso científico.

Ejecutaban experimentos extraños o poco útiles.

En algunos casos utilizaban conjuntos de datos demasiado pequeños para extraer conclusiones significativas.

Tenían problemas para explicar claramente los resultados.

Y, fundamentalmente, no conseguían realizar aportes originales suficientemente importantes.

Los agentes podían ejecutar el trabajo.

Lo que les costaba era decidir qué trabajo valía la pena ejecutar.

El problema de saber cuándo una idea es mala

Esta diferencia resulta fundamental.

Una investigación científica rara vez avanza en línea recta.

Un investigador puede comenzar con una hipótesis aparentemente prometedora y descubrir después de varios experimentos que estaba equivocado.

Entonces debe decidir si modifica parcialmente su estrategia o abandona completamente la idea y comienza nuevamente.

Los agentes mostraron dificultades precisamente allí.

Podían realizar pequeños cambios cuando algo no funcionaba, pero les costaba reconsiderar profundamente el camino elegido.

También tendían a comprometerse demasiado rápido con estrategias poco prometedoras.

En otras palabras, tenían capacidad para trabajar sobre una idea, pero todavía carecían de parte del criterio necesario para juzgar esa idea.

Incluso descartaron buenas hipótesis demasiado rápido

El experimento reveló una paradoja particularmente interesante.

Los agentes llegaron a generar algunas hipótesis novedosas y ambiciosas que se parecían a ideas consideradas por los propios investigadores humanos.

Eso significa que podían producir propuestas potencialmente interesantes.

Sin embargo, en determinados casos terminaron descartándolas después de realizar pruebas demasiado limitadas.

La dificultad no estaba solamente en generar ideas.

También estaba en reconocer cuándo una idea merecía seguir siendo investigada.

Y esa capacidad resulta difícil de medir mediante los benchmarks tradicionales utilizados para evaluar inteligencia artificial.

El problema de los exámenes con respuesta correcta

Gran parte del extraordinario avance reciente de la IA puede medirse porque existen tareas donde sabemos cuál es la respuesta.

Un programa funciona o no funciona.

Una ecuación está correctamente resuelta o no.

Un modelo obtiene determinada puntuación en una prueba.

Cuando existe una métrica clara, los sistemas pueden optimizarse para mejorarla.

Pero la investigación científica funciona de otra manera.

Nadie entrega al investigador una lista indicando qué hipótesis debe probar.

Tampoco existe siempre una puntuación que determine inmediatamente si un experimento fue interesante.

Parte del trabajo consiste justamente en formular las preguntas correctas.

Y ahí los humanos todavía parecen conservar una ventaja importante.

¿Qué significa que una IA se mejore a sí misma?

La denominada mejora recursiva parte de una idea aparentemente sencilla.

Si una inteligencia artificial puede ayudar a construir una IA mejor, esa segunda generación podría utilizar su mayor capacidad para construir una tercera todavía superior.

El ciclo podría repetirse.

En su versión más extrema, esta hipótesis conduce a la denominada “explosión de inteligencia”: una aceleración muy rápida del desarrollo tecnológico producida por sistemas capaces de mejorar sucesivamente sus propias capacidades.

Los modelos actuales ya participan parcialmente de su propio desarrollo.

Pueden escribir código, generar datos sintéticos, ayudar en procesos de entrenamiento, optimizar componentes y colaborar con investigadores humanos.

Pero eso no significa que el circuito pueda funcionar completamente sin personas.

Las empresas quieren automatizar al investigador

Existe una razón económica enorme para conseguirlo.

Los principales laboratorios de inteligencia artificial emplean investigadores altamente especializados y destinan enormes cantidades de dinero a desarrollar cada nueva generación de modelos.

Si una IA pudiera realizar una parte creciente de ese trabajo, el desarrollo podría acelerarse considerablemente.

OpenAI ha planteado explícitamente el objetivo de construir investigadores automatizados.

Anthropic también considera que la participación creciente de la IA en el desarrollo de nuevos sistemas representa uno de los próximos grandes pasos de la industria.

La recompensa potencial es enorme.

Una IA capaz de acelerar la investigación sobre IA podría convertirse en una herramienta para acelerar su propio progreso.

Ingeniería extraordinaria, creatividad limitada

Los resultados del nuevo trabajo no demuestran que la mejora recursiva sea imposible.

Muestran algo diferente.

Todavía falta resolver una parte fundamental del problema.

Los agentes actuales pueden ser extraordinariamente capaces cuando reciben objetivos bien definidos y resultados que pueden comprobarse.

Pero la investigación abierta necesita otras habilidades.

Creatividad.

Criterio.

Intuición.

Capacidad para reconocer cuándo un resultado aparentemente bueno no significa demasiado.

Y voluntad de abandonar días de trabajo para comenzar nuevamente desde otro lugar.

Son capacidades difíciles incluso para los científicos humanos.

El futuro podría avanzar a dos velocidades

Existe además una posibilidad interesante.

La inteligencia artificial podría continuar mejorando rápidamente en tareas donde los resultados pueden verificarse de manera automática y progresar mucho más lentamente en aquellas que requieren criterio abierto.

Eso produciría una evolución tecnológica desigual.

Podríamos tener sistemas extraordinariamente buenos programando, optimizando modelos o resolviendo problemas matemáticos definidos, pero mucho menos eficaces a la hora de decidir qué problema nuevo debería resolverse.

La frontera entre ambas capacidades será una de las cuestiones centrales de los próximos años.

La pregunta del billón de dólares

La gran incógnita es cuánto importa realmente esa creatividad para construir inteligencias artificiales superiores.

Una posibilidad es que desarrollar modelos radicalmente mejores requiera nuevos descubrimientos conceptuales, equivalentes a los grandes saltos que transformaron anteriormente el campo.

Si es así, el criterio científico humano seguirá siendo difícil de reemplazar.

La otra posibilidad es que gran parte del camino necesario ya haya sido descubierto y que mejorar los sistemas dependa principalmente de optimizar código, entrenamiento, datos y capacidad de cómputo.

En ese escenario, las fortalezas actuales de los agentes podrían ser suficientes para acelerar considerablemente el desarrollo.

Todavía no sabemos cuál de las dos posibilidades está más cerca de la realidad.

Y ahí reside probablemente lo más importante del experimento.

La pregunta ya no es simplemente si una inteligencia artificial puede escribir código, ejecutar experimentos o redactar un trabajo científico.

La pregunta verdaderamente difícil es otra:

¿puede saber por sí misma qué merece la pena descubrir?

Escrito por Diario Sonar

Valóralo

Comentarios de las entradas (0)

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *