Claude ya lidera el 26 % del trabajo de investigación y desarrollo de inteligencia artificial realizado dentro de Anthropic. La cifra muestra cómo los modelos avanzados comienzan a participar directamente en la creación de las tecnologías que eventualmente los reemplazarán.

Sin embargo, el dato no significa que Claude sea capaz de diseñar de forma independiente su próxima versión. Anthropic aclara que los humanos continúan supervisando el proceso y que ninguna parte analizada de su investigación ha alcanzado un nivel de autonomía completa.
La empresa publicó estas cifras como parte de una propuesta para medir la velocidad con la que progresa la inteligencia artificial dentro de los laboratorios más avanzados. Su objetivo es ofrecer información pública sobre automatización, vigilancia de agentes y recursos destinados a la seguridad.
Qué significa que Claude “lidere” una tarea
Anthropic utilizó una escala de seis niveles desarrollada por Epoch AI. Esta clasificación comienza en AL0, cuando no existe participación de inteligencia artificial, y termina en AL5, cuando el sistema trabaja de manera completamente autónoma y sin intervención humana.
En el nivel AL3, denominado “colabora”, la IA realiza partes importantes de una tarea bajo instrucciones cercanas. En AL4, identificado como “lidera”, el modelo puede recibir un objetivo general, completar la mayor parte del proceso y entregar un resultado, mientras una persona mantiene la supervisión.
Claude se encuentra en AL4 para el 26 % del trabajo analizado. Por lo tanto, el modelo puede llevar una tarea desde una instrucción inicial hasta una solución casi completa, pero todavía depende de revisión y orientación humana.
Más del 90 % del trabajo de investigación de Anthropic alcanza al menos el nivel de colaboración. No obstante, la empresa asegura que Claude no funciona en AL5 dentro de ninguna de las áreas medidas.
Un crecimiento acelerado en pocos meses
La evolución resulta especialmente llamativa por su velocidad. En febrero de 2026, Claude lideraba menos del 1 % del trabajo de investigación y desarrollo de la compañía. En agosto, esa proporción había aumentado hasta el 26 %.
Para realizar la medición, Anthropic examinó registros internos y una muestra del trabajo desarrollado por su personal. El análisis produjo aproximadamente 15.000 tareas detalladas, que posteriormente se organizaron en una estructura de 542 categorías.
Entre estas actividades se encuentran la identificación de defectos, la evaluación de modelos, el análisis de resultados y otras labores técnicas relacionadas con el desarrollo de sistemas avanzados.
La metodología todavía tiene limitaciones. La propia compañía reconoce que está utilizando modelos de Claude para evaluar parte de su trabajo, lo que podría introducir errores similares en el sistema analizado y en el encargado de medirlo.
Anthropic utiliza aproximadamente 30.000 agentes
Durante agosto, alrededor de 30.000 agentes de inteligencia artificial realizaban tareas de investigación e ingeniería simultáneamente en la plataforma interna más utilizada por Anthropic.
La cifra no representa 30.000 empleados ni 30.000 versiones diferentes de Claude. Se refiere a procesos de software capaces de ejecutar acciones, analizar información y completar trabajos asignados dentro de la infraestructura de la empresa.
Todos esos agentes pasan por dos mecanismos de supervisión. El sistema en línea revisa cada acción antes de ejecutarla y puede bloquear comportamientos potencialmente peligrosos. El sistema fuera de línea analiza posteriormente las actividades para identificar patrones que podrían haber pasado inadvertidos.
Cuántas acciones fueron bloqueadas
Anthropic analizó más de 1.000 millones de decisiones tomadas por sus agentes durante agosto. El monitor en tiempo real bloqueó el 0,002 % de ellas, equivalente aproximadamente a una de cada 47.000 decisiones.
Un porcentaje pequeño no significa que la supervisión sea innecesaria. Precisamente, el propósito del sistema es detectar acciones poco frecuentes que podrían tener consecuencias importantes, como el intento de copiar información protegida o actuar fuera de los permisos establecidos.
Por otra parte, los monitores posteriores marcan alrededor de 100.000 transcripciones semanales para una clasificación adicional. Después de eliminar falsos positivos, aproximadamente 50 casos de mayor prioridad llegan cada semana a una revisión humana.
Anthropic planea incorporar evaluadores externos que puedan comprobar estos procesos y revisar las métricas con acceso comparable al de sus equipos internos de riesgo.
La seguridad también consume capacidad de cómputo
La empresa también intentó calcular cuántos recursos destina a tareas de seguridad. Durante una semana tomada como muestra en julio, alrededor del 6 % de la capacidad informática utilizada para investigación y desarrollo se relacionó con seguridad.
La proporción llegó al 12 % cuando se comparó únicamente con la capacidad utilizada en investigación automatizada por IA. Anthropic considera estas cifras conservadoras porque algunas tareas pueden beneficiar la seguridad sin estar clasificadas expresamente dentro de esa área.
Publicar estos datos permite comparar si las medidas de vigilancia avanzan al mismo ritmo que la autonomía de los modelos.