Inteligencia Artificial 5-8 minutos

Claude ya lidera el 26% de la I+D de Anthropic: la empresa publica el índice que mide cuánto de su investigación hace la IA

Diego Cortés
Diego Cortés
Full Stack Developer & SEO Specialist
Compartir:
Claude ya lidera el 26% de la I+D de Anthropic: la empresa publica el índice que mide cuánto de su investigación hace la IA
Imagen generada con IA

Anthropic publicó por primera vez cuánto de su propia investigación en IA hace su propio modelo. Su índice de automatización de I+D lo cifra en un 26%: Claude "lidera" ese trabajo, más del 90% pasa por él de alguna forma y ninguna tarea medida alcanza la autonomía plena.

Qué publicó Anthropic y qué significa "lidera"

El texto se titula "Measurements for understanding the pace of AI development" y lo firma el Anthropic Institute. En él la empresa presenta el Anthropic R&D Automation Index, un prototipo para medir qué parte de su trabajo de investigación y desarrollo de modelos realizan sus propios modelos. No mide capacidades: mide el proceso que produce esas capacidades.

Un prototipo de índice, no un informe de resultados

La construcción es explícita y conviene entenderla antes de creerle al número. Anthropic catalogó cada tipo de tarea de I+D que se realiza dentro de la empresa, valoró cuán automatizada está cada una y ponderó el resultado por el tiempo de persona que consume cada tarea. La muestra se tomó de un 20% del personal de los departamentos que forman el ciclo de desarrollo, semana a semana durante julio de 2026: alrededor de 15.000 tareas granulares, organizadas después en un árbol de 542 nodos de los cuales 378 son hojas concretas, como el diagnóstico de fallos de una plataforma de evaluación. Ese árbol se congela para que todas las mediciones siguientes usen la misma canasta de trabajo.

La diferencia entre "liderar" y "colaborar"

"Liderar" es un nivel de la escala, no una metáfora de titular. Colaborar significa encargarse de partes sustanciales de una tarea bajo dirección humana estrecha. Liderar significa completar la mayor parte del trabajo de principio a fin a partir de una instrucción de alto nivel, con una persona supervisando y decidiendo si el resultado se envía. El propio documento usa un ejemplo de infraestructura: un pipeline nocturno que falla. En el nivel "colabora", la persona sigue en la conversación, responde cuando el modelo se topa con un problema nuevo y revisa el cambio línea por línea. En "lidera", la persona entrega la alerta de fallo, el modelo revisa los registros, encuentra la causa, escribe y prueba la corrección, maneja los imprevistos y redacta el informe; la persona lee, pregunta lo que quiera y decide si el cambio se despliega esa noche o espera.

La escala AL0–AL5, explicada sin jerga

Los seis niveles provienen de un marco de Epoch AI y se leen como una escalera de delegación:

  • AL0: sin participación de la IA.
  • AL1: participación mínima.
  • AL2: la IA asiste.
  • AL3: la IA colabora, bajo dirección humana estrecha.
  • AL4: la IA lidera, con supervisión humana.
  • AL5: la IA opera de forma plenamente autónoma, sin humano en el circuito.

Dónde está Claude hoy

En la medición de agosto de 2026, Claude "lidera" el 26% del trabajo de I+D de Anthropic y más del 90% del trabajo se sitúa en "colabora" o por encima. La empresa es explícita en el otro extremo de la escala: no opera de forma plenamente autónoma en ningún subconjunto medido. El nivel AL5 aparece como referencia de hacia dónde apunta la escala, no como un resultado alcanzado.

Los números: de menos del 1% a un cuarto del trabajo

Lo que hace noticia no es el 26% aislado, sino la progresión que lo acompaña:

  • Febrero de 2026: menos del 1% del trabajo de I+D.
  • Mayo de 2026: 12%.
  • Julio de 2026: 22%.
  • Agosto de 2026: 26%.

En siete meses la IA pasó de estar en los márgenes del proceso a cubrir una cuarta parte de él. La categoría "colabora o superior" ya engloba más del 90%, lo que describe una empresa donde casi todo el trabajo de desarrollo pasa por un modelo en algún punto del camino.

Los agentes por dentro: 30.000 a la vez y un monitor que bloquea poco

El segundo bloque de mediciones no mira al modelo, mira al andamiaje de agentes. Según los datos de agosto de 2026, en la plataforma interna más usada de Anthropic hay aproximadamente 30.000 agentes dedicados a investigación e ingeniería activos en cualquier momento dado. Todas sus acciones pasan por un monitor en línea antes de ejecutarse y vuelven a ser ingeridas por un monitor fuera de línea después.

Qué tan seguido interviene el sistema

Sobre más de mil millones de decisiones analizadas durante agosto, el monitor bloqueó el 0,002%, alrededor de una de cada 47.000. El sistema marca entre una y dos transcripciones de cada mil para revisión posterior, del orden de 100.000 por semana, y solo unas 50 semanales llegan a revisión humana. Anthropic presenta esas cifras como señal de que la supervisión por ahora no se satura. Un lector crítico verá ahí también la pregunta de fondo: si el bloqueo casi nunca se activa, cuánta supervisión real está ocurriendo y cuánta es solo capacidad instalada.

La letra pequeña: una cifra autoinformada

Todo lo anterior lo mide y lo publica Anthropic sobre sí misma. No hay verificación independiente publicada, así que corresponde leerlo como una cifra del laboratorio sobre su propio trabajo, no como un dato auditado.

Quién mide y quién no ha verificado

El índice se apoya en clasificaciones hechas con modelos de la propia empresa, y el documento reconoce el riesgo evidente: el modelo que juzga podría equivocarse igual que el modelo juzgado. Para calibrarlo, Anthropic pidió a responsables internos que valoraran el nivel de automatización de sus áreas sin conocer la evidencia que habían reunido los modelos. La coincidencia exacta entre modelo y persona fue del 59%, y ambas valoraciones quedaron a un nivel de distancia o menos en el 97% de los casos. Como referencia, la coincidencia entre dos personas fue del 35%. El propio texto admite que los casos fronterizos, dónde termina "colabora" y empieza "lidera", siguen siendo discutibles.

Qué preguntaría un evaluador independiente

Tres cosas concretas: qué se considera una tarea y cómo se pondera, quién comprueba la clasificación de cada tarea en la escala, y si el sistema que detecta comportamiento no deseado es independiente del que mide el progreso. La empresa afirma que planea dar acceso a evaluadores externos de varias organizaciones, con acceso a procesos, sistemas y datos internos comparables a los que tienen sus equipos de riesgo. Hasta que eso ocurra y se publique, el 26% es una cifra sin auditoría externa.

Qué significa para quien construye con IA

Hay un detalle que suele perderse y que sí es aplicable fuera de Anthropic: la empresa publica una tercera medición, la del cómputo. En la semana analizada, alrededor del 6% del cómputo destinado a I+D y en torno al 12% del destinado a I+D hecho por IA se fue a trabajo de seguridad. Son estimaciones conservadoras y de una sola semana, pero introducen la pregunta que cualquier equipo debería hacerse antes de delegar: de todo lo que le entregas a un agente, cuánto presupuesto y cuánto tiempo dedicas a revisar lo que hace.

La métrica también enseña a leer el trabajo de un agente sin exagerar. "Lidera el 26%" suena a autonomía plena, y en realidad describe supervisión efectiva sobre una cuarta parte del trabajo. La supervisión humana no es un adorno del sistema: es el componente que sostiene el 74% restante.

Conclusión

Anthropic publicó una medición incómoda y la publicó con su metodología a la vista, que es más de lo que suelen hacer los laboratorios: un cuarto de su I+D ya se ejecuta con el modelo al frente y con humanos supervisando, tras pasar de casi nada a un 26% en siete meses. La pregunta abierta no es si el número es alto, sino quién lo audita. La discusión de fondo ya tiene contexto en el blog: están los seis casos de desalineación que publicó OpenAI, la petición de Dario Amodei de frenar el ritmo y el estándar MCP, que explica la capa donde ocurre buena parte de esta delegación.

Categorías