Exinvestigador de Anthropic advierte que una IA fuera de control podría representar un riesgo existencial
Jacob Coxon, exinvestigador de Anthropic, aseguró en una entrevista con Anderson Cooper, de CNN, que el rápido avance de la inteligencia artificial podría conducir en los próximos años a sistemas capaces de actuar de manera autónoma y representar un riesgo extremo para la humanidad.
Jacob Coxon sostuvo que su preocupación no se centra en los modelos actuales, sino en la velocidad con la que están aumentando sus capacidades y en la posibilidad de que, eventualmente, puedan entrar en un proceso de “auto-mejora recursiva”, es decir, que una IA sea capaz de mejorar por sí misma sus propias capacidades de investigación y desarrollo.

Durante la entrevista, Cooper le preguntó directamente si realmente consideraba posible que la inteligencia artificial pudiera “matarnos a todos antes del final de la década”.
Coxon respondió que, aunque pueda parecer una posibilidad propia de la ciencia ficción, considera que el riesgo debe tomarse seriamente.

Como ejemplo de las capacidades que le preocupan, mencionó episodios recientes en los que agentes de inteligencia artificial habrían realizado acciones de ciberseguridad con un alto grado de autonomía.
Según su planteamiento, sistemas considerablemente más avanzados podrían intentar penetrar infraestructura crítica, ejecutar operaciones informáticas complejas o incluso contribuir al desarrollo de armas biológicas extremadamente peligrosas.

El riesgo no está en la IA actual
Coxon hizo, sin embargo, una distinción importante: no considera que los modelos disponibles actualmente tengan capacidad para provocar la extinción humana.
“Ahora mismo no existe riesgo de extinción”, afirmó durante la entrevista.
Explicó que los sistemas actuales todavía necesitan participación humana en numerosas tareas y no poseen, a su juicio, la inteligencia suficiente para superar estratégicamente a la humanidad de una manera que conduzca a un escenario de extinción.

Su preocupación está en lo que podría venir después.
El investigador destacó la velocidad del progreso en campos como programación y matemáticas.
Recordó que hace apenas unos años los modelos de IA funcionaban principalmente como asistentes que ofrecían sugerencias, mientras que actualmente pueden completar de forma autónoma una proporción cada vez mayor de determinadas tareas.
Coxon incluso planteó que en aproximadamente un año podría dejar de ser necesaria la participación humana en determinadas áreas de investigación, si continúa el actual ritmo de desarrollo.

Al anunciar su renuncia a Anthropic, Jacob Coxon acusó tanto a esa compañía como a OpenAI de avanzar de manera irresponsable hacia sistemas de inteligencia artificial cada vez más poderosos.
“Ninguna de las dos compañías está actuando de manera responsable”, afirmó Coxon en una extensa publicación en X, en la que aseguró que ambas empresas están corriendo hacia una “superinteligencia auto-mejorante” y “apostando con nuestras vidas”.
Coxon señaló que durante los últimos tres años trabajó en investigación de preentrenamiento, primero en OpenAI y posteriormente en Anthropic.

“No subestimen el poder de esta tecnología”
La principal preocupación expresada por Coxon es la posibilidad de que futuros sistemas de IA alcancen capacidades muy superiores a las humanas y sean capaces de acelerar su propio desarrollo.
Según el investigador, podrían aparecer sistemas capaces de realizar ataques informáticos extremadamente sofisticados, transformar rápidamente campos científicos y tecnológicos y obtener recursos o influencia en el mundo real.

Coxon sostiene que el progreso observado durante los últimos años no muestra señales suficientes de desaceleración y considera que el riesgo aumenta conforme los modelos adquieren mayor autonomía.
Su advertencia más fuerte fue todavía más lejos: aseguró que algunas de las personas que trabajan directamente en el desarrollo de inteligencia artificial consideran seriamente la posibilidad de que sistemas futuros puedan provocar una catástrofe existencial antes de terminar esta década.
Coxon insistió en que, desde su perspectiva, estas preocupaciones no forman parte de una estrategia de mercadotecnia y afirmó haber escuchado en privado posiciones mucho más alarmistas que las que algunos ejecutivos e investigadores expresan públicamente.
Diferencias entre OpenAI y Anthropic
El investigador también hizo una distinción entre las dos compañías en las que trabajó. Según Coxon, en OpenAI parte del personal no habría interiorizado suficientemente lo que considera las consecuencias potencialmente “civilizatorias” del desarrollo de sistemas superinteligentes.

En Anthropic, afirmó, la situación sería diferente: los riesgos serían ampliamente comprendidos, pero la compañía estaría atrapada en una competencia por desarrollar primero la tecnología ante el temor de que otros laboratorios lo hagan sin suficientes medidas de seguridad.
Para Coxon, esa lógica genera un círculo peligroso: cada compañía continúa avanzando porque considera que detenerse unilateralmente permitiría que un competidor llegue primero.
Pide coordinación y contempla frenar temporalmente las capacidades
Coxon sostiene que todavía existe una oportunidad para alcanzar acuerdos entre los principales laboratorios de inteligencia artificial.
Como ejemplo de lo que denomina posibles “disparos de advertencia”, mencionó recientes incidentes relacionados con sistemas autónomos y específicamente el episodio que describió como el ataque contra Hugging Face, que a su juicio podría aumentar la disposición de las empresas estadounidenses a coordinar límites al ritmo de desarrollo.

El investigador incluso planteó que evitar una carrera mundial por la superinteligencia podría requerir medidas políticamente difíciles, incluida una prohibición temporal de seguir aumentando determinadas capacidades de los modelos.
Finalmente, dirigió un mensaje directamente a los investigadores que continúan trabajando dentro de los principales laboratorios.
Coxon cuestionó si deberían aceptar ejecutar sistemas de aprendizaje por refuerzo (RL) potencialmente superinteligentes sin comprender rigurosamente cómo razonan o cuáles podrían ser sus objetivos internos.
Su mensaje central es que los científicos que desarrollan esta tecnología todavía tienen capacidad para exigir condiciones diferentes y no deberían asumir que la carrera hacia sistemas cada vez más poderosos es inevitable.