Autoresearch: Karpathy crea un laboratorio de IA que investiga solo mientras duermes

Share

Andrej Karpathy acaba de lanzar autoresearch, un proyecto open source que convierte a un agente de IA en investigador autónomo de machine learning. La idea: dale una GPU, un código de entrenamiento real y un archivo Markdown con instrucciones. Vete a dormir. Despierta con 100 experimentos completados y — si todo va bien — un modelo mejor que el que dejaste anoche.

El repo ya acumula miles de estrellas en GitHub en menos de 24 horas, y el hilo en Hacker News se llenó de debate. Pero más allá del hype, lo que Karpathy está proponiendo aquí es un cambio de paradigma en cómo se hace investigación en IA.

¿Qué es autoresearch?

Autoresearch es un sistema deliberadamente minimalista. Tres archivos que importan:

Aprende IA con nosotros

Únete gratis a mi comunidad en Skool, donde compartimos noticias, tutoriales y recursos para seguir aprendiendo juntos.

👥 Únete gratis 🚀
  • train.py: el archivo que el agente modifica libremente. Contiene el modelo GPT completo, los optimizadores (Muon + AdamW), y el loop de entrenamiento. Arquitectura, hiperparámetros, batch size — todo es territorio del agente.
  • program.md: las instrucciones en Markdown que el humano escribe para guiar al agente. Es, en esencia, el “código” del investigador humano — solo que en lenguaje natural.
  • prepare.py: preparación de datos y utilidades. Fijo, no se toca.

El ciclo es simple: el agente modifica el código, entrena por exactamente 5 minutos, mide el resultado (val_bpb — bits por byte en validación), decide si el cambio mejoró o empeoró, y repite. Un loop autónomo que corre indefinidamente en una sola GPU.

Del vibe coding al vibe researching

Si te suena familiar, es porque Karpathy ya nos cambió la cabeza una vez. En febrero de 2025 acuñó el término vibe coding — la idea de que puedes “programar” describiendo lo que quieres en lenguaje natural y dejando que la IA genere el código. Autoresearch lleva esa filosofía un paso más allá: no solo el código se genera solo, sino que la investigación misma se automatiza.

Tú ya no escribes Python para experimentar. Escribes un program.md que describe qué quieres que el agente explore. Es como un prompt engineering aplicado a la investigación científica. Y cada 5 minutos, el agente completa un experimento — unos 12 por hora, ~100 por noche.

¿Por qué no usar simplemente un barrido de hiperparámetros?

Esta fue la pregunta más repetida en Hacker News. Y la respuesta de Karpathy es contundente: esto es fundamentalmente distinto a técnicas como BayesOpt o grid search, por tres razones:

  • Modifica código, no solo parámetros. El agente puede cambiar la arquitectura del modelo, el optimizador, la lógica del training loop. El concepto de “hiperparámetro” se disuelve — todo es modificable.
  • Es secuencial e inteligente. En vez de lanzar sweeps paralelos que desperdician cómputo, el agente trabaja secuencialmente. Puede hacer búsqueda binaria para encontrar el valor óptimo de un parámetro en pocos intentos, en vez de probar cientos de combinaciones.
  • Es completamente autónomo. No necesita un humano ajustando qué parámetros barrer ni definiendo rangos. El agente decide qué probar basándose en lo que ha aprendido de experimentos anteriores.

La ventana fija de 5 minutos: un truco elegante

Uno de los detalles más astutos del diseño es que cada experimento dura exactamente 5 minutos de reloj (excluyendo startup y compilación). Esto hace que cada resultado sea directamente comparable, sin importar qué GPU tengas. Un H100, una RTX 3090 — el presupuesto de tiempo es el mismo. La métrica val_bpb tampoco depende del tamaño del vocabulario, así que incluso si el agente cambia el tokenizador, los resultados siguen siendo comparables entre sí.

La intro sci-fi que merece atención

Karpathy abre el README del repo con un texto que parece sacado de una novela de ciencia ficción:

“Un día, la investigación de IA de frontera la hacían computadores de carne entre comidas, siestas y diversión, sincronizándose de vez en cuando mediante ondas sonoras en el ritual de la ‘reunión de grupo’. Esa era terminó hace mucho. La investigación ahora pertenece enteramente a enjambres autónomos de agentes de IA corriendo en megaestructuras de cómputo en los cielos. Los agentes afirman que estamos en la generación 10.205 del código, aunque nadie podría verificarlo porque el ‘código’ es ahora un binario auto-modificable que creció más allá de la comprensión humana. Este repo es la historia de cómo todo comenzó.”

“Parte código, parte ciencia ficción, y una pizca de psicosis”, como el mismo Karpathy lo describe. Pero esa pizca de psicosis es exactamente lo que hace pensar.

Por qué importa

Autoresearch no va a reemplazar a los investigadores de IA mañana. Pero sí señala un futuro muy concreto: el de investigadores que “programan” sus agentes en Markdown, comparan qué instrucciones producen progreso más rápido, y dejan que las máquinas hagan el trabajo tedioso de experimentar.

Como dijo un usuario en Hacker News: “Cualquier tarea humana que se pueda verificar objetivamente en un entorno como este, se puede automatizar completamente.” Y otro apuntó que roles como “AI Ops” o “Agent Reliability Engineer” podrían volverse tan importantes como DevOps hoy.

La comunidad ya está moviendo piezas — herramientas como Glaze democratizan el vibe coding, y Codex de OpenAI lleva agentes de código a tu terminal. Autoresearch lleva esa misma lógica al laboratorio de investigación. Y como siempre con Karpathy, lo hace en 630 líneas de código.


Fuentes

Leer más

Otras noticias