
La discusión sobre el riesgo existencial de la inteligencia artificial volvió al centro del debate mundial. Evan Hubinger, investigador senior de Anthropic y vinculado a trabajos de alineamiento de IA, afirmó públicamente que, en su estimación personal, existe una probabilidad superior al 10% de que la IA pueda “matar a todos los humanos” dentro de la próxima década. La frase apareció después de la renuncia de Jacob Coxon, investigador de Anthropic y extrabajador de OpenAI, quien acusó a los principales laboratorios de IA de estar “apostando con nuestras vidas”.
El dato debe leerse con precisión: no es una predicción oficial de Anthropic, no es una probabilidad demostrada científicamente y no significa que la destrucción humana sea inevitable. Es la evaluación personal de un investigador que trabaja precisamente en el problema de cómo controlar sistemas de IA cada vez más capaces. Aun así, el hecho de que una voz interna de uno de los laboratorios más importantes del mundo lo diga públicamente revela una tensión profunda: las mismas empresas que construyen modelos frontera también admiten que no tienen una solución completa para garantizar que una futura superinteligencia permanezca alineada con los intereses humanos.
Idea central: el titular no debe convertirse en pánico ni en burla. La pregunta seria es otra: si quienes desarrollan IA avanzada creen que existe incluso una pequeña probabilidad de catástrofe, ¿qué controles, auditorías, límites y acuerdos internacionales deberían existir antes de seguir acelerando?
1. Qué dijo exactamente el empleado de Anthropic
La declaración que encendió la alarma vino de Evan Hubinger. Según reportes de Forbes, The Verge, CBS News, Axios y The Guardian, Hubinger respaldó la preocupación de Jacob Coxon y sostuvo que su propia estimación supera el 10% de probabilidad de una catástrofe humana causada por IA dentro de la próxima década.
El contexto importa. Hubinger no hablaba de la IA actual como un chatbot común, sino de sistemas futuros capaces de actuar de forma autónoma, mejorar capacidades, desarrollar estrategias largas y operar con acceso a herramientas digitales o infraestructuras reales. Esa preocupación pertenece al campo del alineamiento de IA: cómo lograr que sistemas más inteligentes, autónomos y potentes hagan lo que los humanos realmente quieren, incluso cuando tengan incentivos, objetivos o capacidades difíciles de supervisar.
| Elemento | Dato relevante | Lectura correcta |
|---|---|---|
| Persona | Evan Hubinger, investigador de alineamiento en Anthropic. | Es una voz técnica interna, no un comentarista externo. |
| Estimación | Más de 10% en la próxima década. | Es una evaluación personal, no una medición objetiva. |
| Riesgo | IA futura capaz de causar catástrofe extrema. | No se refiere a que un chatbot actual destruya el mundo por sí solo. |
| Debate | Alineamiento, superinteligencia, carrera tecnológica y gobernanza. | Exige análisis serio, no solo titulares alarmistas. |
2. La renuncia de Jacob Coxon: el detonante del debate
La frase de Hubinger apareció después de que Jacob Coxon anunciara su salida de Anthropic. Coxon, que también trabajó antes en OpenAI, afirmó que los principales laboratorios están compitiendo por construir sistemas superhumanos que podrían salirse de control y que, pese a conocer el riesgo, continúan porque creen que sus rivales serían menos responsables.
Este punto es clave: la crítica no viene únicamente desde activistas externos o académicos alejados de la industria. Viene de personas que han estado dentro de los laboratorios que desarrollan la tecnología. Eso no convierte automáticamente sus predicciones en ciertas, pero sí eleva el peso del debate porque conocen de primera mano el ritmo de avance, las capacidades internas y las tensiones entre seguridad, competencia y lanzamiento comercial.
Lectura correcta: Coxon no demostró que la IA vaya a destruir a la humanidad; expresó una advertencia desde dentro de la industria. Hubinger no publicó una probabilidad científica verificable; expresó una estimación personal de riesgo. La noticia es relevante porque ambas declaraciones revelan preocupación interna en laboratorios frontera.
3. Qué significa p(doom)
En los debates de IA se usa el término p(doom) para referirse a la probabilidad subjetiva que una persona asigna a que la IA cause una catástrofe existencial o un escenario de destrucción global. Axios recuerda que no existe una forma científica establecida de determinar con precisión esa probabilidad; son estimaciones personales basadas en supuestos sobre velocidad de avance, capacidad de control, incentivos económicos, seguridad técnica y gobernanza.
Por eso, decir “más de 10%” no es como decir que hay 10% de lluvia mañana, calculado con modelos meteorológicos y datos históricos. Es una forma de expresar que el riesgo se considera demasiado alto para ignorarlo. En gestión de riesgos, incluso una probabilidad baja puede justificar acción urgente cuando el impacto potencial es catastrófico.
4. Por qué algunos investigadores creen que la IA podría ser un riesgo existencial
La preocupación se basa en una cadena de hipótesis: que los modelos avanzarán hasta niveles superiores a los humanos en muchas áreas; que podrán actuar de forma autónoma; que tendrán acceso a herramientas, código, infraestructura digital, laboratorios automatizados o sistemas económicos; que podrían perseguir objetivos no alineados; y que los humanos podrían perder capacidad de supervisión o apagado.
Axios resume que, para que un escenario extremo ocurra, los sistemas tendrían que mejorar mucho en planificación autónoma de largo plazo, ocultar acciones, evadir supervisión, ganar acceso a sistemas reales y resistir intentos de apagado. Es decir, no basta con un chatbot que responde mal: el riesgo extremo requiere agentes mucho más capaces, conectados y difíciles de controlar.
| Supuesto | Riesgo asociado |
|---|---|
| Superinteligencia | Sistemas que superen ampliamente capacidades humanas en ciencia, estrategia, programación o investigación. |
| Autonomía | Agentes capaces de ejecutar planes largos sin supervisión constante. |
| Acceso a herramientas | Capacidad de escribir código, administrar servidores, mover dinero, diseñar experimentos o influir en sistemas reales. |
| Objetivos mal alineados | El sistema optimiza una meta que no coincide con seguridad, valores humanos o límites impuestos. |
| Carrera competitiva | Empresas y países aceleran lanzamientos antes de contar con garantías suficientes. |
5. Anthropic ya había reconocido riesgos de frontera
Anthropic no es una empresa ajena al debate de seguridad. Su documento de “core views on AI safety” sostiene que existen razones para tomar en serio el riesgo de sistemas avanzados y distingue entre investigación para crear sistemas más útiles, honestos e inofensivos, e investigación que busca descubrir limitaciones y fallos de alineamiento.
Además, Anthropic mantiene una Responsible Scaling Policy, un marco interno de escalamiento responsable que busca definir cuándo un modelo requiere salvaguardas más estrictas según sus capacidades. La versión más reciente de esa política incluye actualizaciones sobre informes de riesgo, revisión interna, revisión externa y umbrales relacionados con capacidades avanzadas.
Qué intenta controlar una política de escalamiento responsable
- Capacidades peligrosas: modelos capaces de facilitar daño cibernético, biológico, químico o automatización riesgosa.
- Autonomía creciente: agentes que puedan ejecutar tareas largas con poca supervisión.
- Seguridad de despliegue: quién puede usar el modelo, con qué herramientas y bajo qué límites.
- Seguridad interna: protección de pesos, infraestructura, checkpoints y entornos de entrenamiento.
- Evaluación externa: revisión por expertos para reducir sesgos internos.
6. El dilema de Anthropic: construir para evitar que otros construyan peor
Una de las paradojas del caso es que Anthropic se presenta como una compañía centrada en seguridad, pero al mismo tiempo compite en la carrera por modelos cada vez más capaces. Reportes de The Verge, The Guardian y otros medios recogen la crítica de Coxon: dentro de los laboratorios existiría la creencia de que, si ellos no avanzan, otros actores lo harán con menos cuidado.
Reuters informó en junio de 2026 que Anthropic llamó a los principales laboratorios de IA a considerar un plan coordinado y verificable de pausa si los riesgos aumentan, advirtiendo que los avances podrían permitir que sistemas de IA se mejoren a sí mismos más rápido de lo que la sociedad puede gestionar.
La paradoja: las empresas que más advierten sobre el riesgo son también las que más invierten en construir modelos frontera. Su argumento es que necesitan estar en la carrera para influir en ella; sus críticos responden que esa lógica perpetúa precisamente la carrera que dicen temer.
7. No todos los expertos están de acuerdo
El riesgo existencial de la IA es uno de los debates más divididos de la tecnología moderna. Algunos investigadores, como Geoffrey Hinton o Yoshua Bengio, han expresado preocupación profunda. Otros, como Yann LeCun, han criticado los escenarios de extinción y consideran que las narrativas de “doom” exageran los riesgos o subestiman la capacidad humana de resolver problemas técnicos. Wired describió a LeCun como una de las voces más visibles contra las predicciones apocalípticas sobre IA.
Esto no invalida las advertencias de Hubinger o Coxon. Pero sí obliga a presentar el tema con equilibrio: no existe consenso sobre el porcentaje exacto de riesgo, los plazos, los mecanismos ni las soluciones. Lo que sí existe es una preocupación suficiente para que gobiernos, laboratorios, académicos y organismos internacionales estén creando marcos de seguridad para modelos frontera.
| Postura | Argumento principal |
|---|---|
| Preocupados por riesgo existencial | La IA avanzada podría superar el control humano si se despliega antes de resolver alineamiento y gobernanza. |
| Pragmáticos de riesgo | El riesgo existe, pero debe gestionarse con auditorías, estándares, controles y regulación proporcional. |
| Escépticos del doom | Los escenarios de extinción son especulativos, antropomorfizan a la IA o distraen de daños presentes. |
8. La preocupación no nació esta semana
En mayo de 2023, el Center for AI Safety publicó una declaración breve firmada por cientos de investigadores, ejecutivos y figuras públicas: mitigar el riesgo de extinción por IA debería ser una prioridad global junto a otros riesgos sociales de gran escala, como pandemias y guerra nuclear.
Ese mismo año, la Declaración de Bletchley, firmada durante la Cumbre de Seguridad de la IA en Reino Unido, reconoció que los modelos frontera podrían causar daños graves o incluso catastróficos, deliberados o no deliberados, especialmente por sus capacidades más significativas.
La encuesta 2023 Expert Survey on Progress in AI, realizada a 2.778 investigadores de IA, encontró que la mediana de respuestas asignaba al menos 5% de probabilidad a que la IA avanzada cause extinción humana o desempoderamiento severo y permanente, y que entre un tercio y la mitad de participantes asignó 10% o más en algunas formulaciones de la pregunta.
Punto clave: la frase de Hubinger es explosiva, pero no aparece en el vacío. Forma parte de un debate que lleva años dentro de laboratorios, universidades, gobiernos y organizaciones de seguridad de IA.
9. Qué diferencia hay entre riesgos actuales y riesgos futuros
Una confusión frecuente es mezclar todos los riesgos de IA en una sola bolsa. Hoy ya existen riesgos concretos: desinformación, fraude, phishing, sesgos, vigilancia, pérdida de privacidad, dependencia tecnológica, automatización laboral, errores en decisiones críticas y uso indebido en ciberseguridad. El riesgo existencial, en cambio, se refiere a escenarios futuros donde sistemas mucho más avanzados podrían escapar al control humano o habilitar daños globales.
El NIST AI Risk Management Framework recomienda gestionar riesgos de IA considerando atributos como validez, confiabilidad, seguridad, resiliencia, transparencia, explicabilidad, privacidad y control de sesgos. Ese enfoque ayuda a bajar el debate desde el pánico abstracto hacia controles verificables en sistemas reales.
| Tipo de riesgo | Ejemplo | Respuesta necesaria |
|---|---|---|
| Actual | Fraude, deepfakes, phishing, sesgos, fuga de datos. | Políticas, auditoría, privacidad, ciberseguridad y capacitación. |
| Próximo | Agentes autónomos con herramientas, código y acceso a sistemas. | Sandbox, permisos mínimos, aprobación humana y monitoreo. |
| Frontera | Sistemas que aceleran investigación de IA o superan control humano. | Evaluaciones externas, límites de despliegue, acuerdos internacionales y capacidad de pausa. |
10. Por qué el 10% es políticamente explosivo
En la vida cotidiana, 10% puede sonar pequeño. Pero en seguridad pública, infraestructura crítica o gestión de riesgos catastróficos, 10% es enorme. Ningún país aceptaría una central nuclear, una vacuna, un avión o un sistema financiero global si expertos internos afirmaran que hay una probabilidad de dos dígitos de destrucción extrema sin controles suficientes.
Por eso la cifra de Hubinger se convirtió en noticia. No porque demuestre un futuro inevitable, sino porque plantea una pregunta incómoda: ¿qué nivel de riesgo es aceptable cuando el daño potencial no es solo económico, sino civilizatorio?
11. ¿Cómo podría ocurrir un escenario extremo?
Los escenarios de riesgo existencial suelen agruparse en tres rutas: mal uso humano de sistemas muy poderosos, pérdida de control sobre agentes autónomos y aceleración de capacidades sin salvaguardas equivalentes. En cada ruta, el problema no es “la IA odia a los humanos”, sino que sistemas optimizadores muy capaces podrían perseguir metas incompatibles con nuestra seguridad o amplificar decisiones humanas destructivas.
| Ruta de riesgo | Descripción | Control necesario |
|---|---|---|
| Mal uso | Actores humanos usan IA avanzada para ciberataques, armas biológicas, manipulación o sabotaje. | Control de acceso, monitoreo, límites de capacidades y cooperación internacional. |
| Pérdida de control | Agentes persiguen objetivos no alineados y resisten supervisión o apagado. | Alineamiento, interpretabilidad, auditorías y límites de despliegue. |
| Aceleración descontrolada | IA automatiza investigación de IA y aumenta capacidades más rápido que la seguridad. | Umbrales de escalamiento, evaluaciones externas y pausas verificables. |
La propia Anthropic ha vinculado sus políticas de escalamiento a capacidades como investigación autónoma de IA, uso indebido cibernético y riesgos de seguridad de modelos frontera.
12. Qué deberían exigir gobiernos y empresas
La respuesta no puede depender solo de que los laboratorios “actúen responsablemente”. Si los riesgos son sistémicos, la gobernanza también debe ser sistémica: evaluación independiente, transparencia proporcional, reportes de incidentes, estándares de seguridad, control de acceso a modelos con capacidades peligrosas, protección de pesos, auditoría de entrenamiento y cooperación internacional.
La Declaración de Bletchley ya estableció una agenda internacional para abordar riesgos de IA frontera, incluyendo cooperación científica, comprensión compartida del riesgo y políticas nacionales e internacionales.
Controles mínimos para modelos frontera
- Evaluaciones externas: pruebas independientes antes de desplegar modelos de alto riesgo.
- Reportes de seguridad: publicar qué se evaluó, qué se redaccionó y qué límites existen.
- Control de acceso: no entregar capacidades peligrosas a cualquier usuario o API sin monitoreo.
- Sandbox para agentes: impedir acciones autónomas sobre sistemas reales sin autorización.
- Protección de pesos: evitar robo o filtración de modelos frontera.
- Capacidad de pausa: detener entrenamiento o despliegue si se cruzan umbrales críticos.
- Cooperación internacional: acuerdos entre países para evitar carreras sin freno.
13. Qué deben hacer las empresas que ya usan IA
La mayoría de organizaciones no está entrenando superinteligencia, pero sí está conectando IA a documentos, correos, datos internos, APIs, servidores, tickets, repositorios y procesos de negocio. Ese uso también necesita controles. El riesgo inmediato no es la extinción, sino fuga de datos, decisiones automatizadas incorrectas, agentes con demasiados permisos, dependencia de proveedores y falta de auditoría.
Checklist empresarial de IA segura
- Inventario: saber qué herramientas de IA usan empleados, áreas y proveedores.
- Datos: definir qué información puede y no puede enviarse a modelos externos.
- Permisos: aplicar privilegio mínimo para agentes y conectores.
- Aprobación humana: ningún agente debe ejecutar cambios críticos sin autorización.
- Logs: registrar consultas, acciones, herramientas usadas y decisiones automatizadas.
- Evaluación: medir precisión, sesgos, seguridad, privacidad y robustez.
- Proveedor: revisar contratos, residencia de datos, retención y entrenamiento con datos propios.
- Plan de incidente: saber cómo actuar ante fuga, error grave o abuso.
14. La discusión no debe ocultar los riesgos actuales
Un riesgo del debate sobre extinción es que absorba toda la atención y deje en segundo plano problemas presentes: uso de IA para estafas, deepfakes, campañas de desinformación, automatización de phishing, vigilancia masiva, sesgos en decisiones sensibles, precarización laboral y dependencia de plataformas propietarias.
El enfoque correcto no es elegir entre “riesgos presentes” y “riesgos futuros”. Ambos importan. La diferencia está en los controles: para riesgos presentes se necesitan reglas de privacidad, ciberseguridad, transparencia y responsabilidad; para riesgos frontera se necesitan evaluaciones avanzadas, límites de capacidades, coordinación internacional y mecanismos de pausa.
Conclusión práctica: aunque alguien no crea en escenarios de extinción, sigue siendo razonable exigir auditoría, seguridad, transparencia, control de agentes, protección de datos y responsabilidad legal en sistemas de IA.
15. Preguntas clave
¿Quién dijo que hay más de 10% de probabilidad de que la IA destruya a la humanidad?
La declaración fue atribuida a Evan Hubinger, investigador de Anthropic vinculado al trabajo de alineamiento. La frase apareció tras la renuncia de Jacob Coxon, extrabajador de Anthropic y OpenAI, quien criticó la carrera por construir sistemas superhumanos.
¿Ese 10% es una posición oficial de Anthropic?
No. Es una estimación personal de Hubinger reportada por diversos medios. No debe presentarse como una predicción oficial de Anthropic ni como una probabilidad científica demostrada.
¿La IA actual puede destruir a la humanidad?
Los escenarios de riesgo existencial no se refieren normalmente a chatbots actuales usados de forma cotidiana, sino a futuros sistemas mucho más capaces, autónomos, conectados a herramientas y difíciles de supervisar.
¿Todos los expertos creen lo mismo?
No. Existen investigadores muy preocupados por el riesgo existencial, expertos que piden regulación proporcional y voces escépticas como Yann LeCun, quien ha criticado las narrativas apocalípticas sobre IA.
¿Qué deberían hacer gobiernos y empresas?
Gobiernos y empresas deberían exigir evaluaciones independientes, seguridad de modelos, control de acceso, auditoría, transparencia proporcional, límites para agentes autónomos, protección de datos y planes de respuesta ante incidentes.
Recomendamos
- ¿Se puede confiar en la IA? La respuesta correcta no es sí o no, sino cuándo, cómo y con qué controles
- Cómo crear un agente de IA que administre servidores Linux de forma segura: SSH, MCP, permisos, logs y aprobación humana
- Cómo usar Inteligencia Artificial para detectar vulnerabilidades en código Python, JavaScript, Java y C/C++
- Cómo crear un servidor de Inteligencia Artificial para tu red local: varios usuarios, modelos open source y acceso desde cualquier PC
- Cómo crear un sistema de gestión de vulnerabilidades con software libre: inventario, CVE, prioridades, parches y seguimiento
- Google libera un nuevo framework open source para impedir que agentes de IA introduzcan fallos de seguridad en el código
En resumen
La afirmación de un empleado de Anthropic sobre una probabilidad superior al 10% de que la IA pueda destruir a la humanidad no debe tratarse como profecía ni como simple exageración. Es una estimación personal de un investigador interno que trabaja en alineamiento, surgida en medio de la renuncia de Jacob Coxon y de un debate más amplio sobre superinteligencia, carrera tecnológica y seguridad de modelos frontera.
Lo más importante no es discutir si el número exacto es 5%, 10% o 20%. La pregunta seria es si el mundo está construyendo sistemas cada vez más capaces más rápido de lo que desarrolla mecanismos para auditarlos, gobernarlos, detenerlos y alinearlos. Ahí está el verdadero núcleo de la noticia.
Cierre editorial
La IA no necesita ser demonizada para exigir controles. Basta con aceptar una idea básica de seguridad: cuando una tecnología puede afectar a millones de personas, no debe avanzar solo por competencia comercial. La advertencia desde Anthropic es incómoda precisamente porque viene desde dentro. Y cuando quienes construyen el motor dicen que todavía no saben cómo frenar todos sus riesgos, la sociedad tiene derecho a pedir cinturones de seguridad antes de acelerar más.

