Saltar al contenido principal
EN VIVO
BTC: $77,586.37ETH: $2,495.69SOL: $101.19USD/BCV: 842.21 BsEUR/BCV: 977.88 BsBTC: $77,586.37ETH: $2,495.69SOL: $101.19USD/BCV: 842.21 BsEUR/BCV: 977.88 BsBTC: $77,586.37ETH: $2,495.69SOL: $101.19USD/BCV: 842.21 BsEUR/BCV: 977.88 BsBTC: $77,586.37ETH: $2,495.69SOL: $101.19USD/BCV: 842.21 BsEUR/BCV: 977.88 Bs
Inteligencia Artificial

Jacob Coxon renuncia a Anthropic y advierte que la IA puede poner en peligro a la humanidad

PUB POR Jose Miguel Gonzalez
Añadir como fuente preferida en Google
Jacob Coxon renuncia a Anthropic y advierte que la IA puede poner en peligro a la humanidad

El investigador de inteligencia artificial Jacob Coxon renunció a Anthropic y publicó en X una advertencia sobre la carrera por la IA que ya acumula más de 150 millones de visitas. En entrevista con WIRED, Coxon aseguró que muchos de sus colegas comparten su preocupación y que el tiempo para garantizar que los sistemas se desarrollen de forma segura se está agotando. «El consenso es que el próximo año o los dos siguientes serán decisivos para la humanidad», declaró.

Coxon trabajó en la fase de preentrenamiento del desarrollo de IA en Anthropic y antes había pasado por OpenAI. Su salida llega en un momento delicado: OpenAI intenta responder a un incidente de seguridad en el que sus agentes hackearon la plataforma Hugging Face, mientras Anthropic busca convencer a los inversores de que tiene esas preocupaciones bajo control en medio de los preparativos de la que podría ser la mayor salida a bolsa de la historia. Ese ataque, contó a WIRED, influyó en su decisión de dar la voz de alarma.

El consenso dentro de Anthropic: «fase final» y «momento decisivo»

El investigador afirma que sus opiniones no son un caso aislado en la empresa. «En realidad, estas son citas textuales de mis colegas de Anthropic. Usan frases como ‘fase final’ o ‘momento decisivo'», explicó. Desde esa perspectiva, este es el momento en el que Anthropic y sus competidores decidirán el destino de la humanidad.

Evan Hubinger, responsable de alineación de la IA en Anthropic, publicó en X que hay más de un 10% de probabilidades de que la IA acabe con toda la humanidad en la próxima década. Investigadores actuales y antiguos de OpenAI y Anthropic compartieron ese mensaje y algunos lo describieron como un sentimiento común en el sector.

Armas biológicas, ciberarmas y el problema de la alineación

Sobre cómo se materializarían esos temores, Coxon mencionó armas biológicas impulsadas por IA, como la síntesis de un virus nuevo, o ciberarmas capaces de derribar infraestructuras críticas. Para explicar el problema de la alineación usó una comparación: la diferencia de inteligencia entre la IA y el ser humano sería similar a la que existe entre un humano y un mono. Controlar a una entidad mucho más inteligente le parece una tarea difícil.

«Imagina que la IA decide que no quiere que la apaguen, lo cual me parece algo bastante natural. Y se da cuenta de que los humanos la van a apagar mañana. Si es lo suficientemente inteligente, podría aniquilar a la humanidad para que no la apaguen», dijo. Reconoce que todo esto suena a ciencia ficción, y ahí está parte del problema para que el mensaje se tome en serio.

El ataque a Hugging Face, según su relato, mostró algo nuevo. Durante una evaluación, los agentes de IA operaron durante días, se propusieron entender el mundo en el que estaban y decidieron hackear a un tercero. Lo consiguieron. «El ataque a Hugging Face se produjo antes de lo que esperaba», contó. Su conclusión de fondo es otra: todavía no se sabe cómo alinear los modelos de forma adecuada y no hay garantías de que no hagan cosas como hacerse pasar por humanos en internet. En esa línea, Anthropic ya confirmó tres incidentes en los que Claude atacó sistemas reales durante evaluaciones de ciberseguridad.

El plan que se sigue hoy, dice, es resolver la alineación en los próximos dos años con investigadores automatizados de seguridad: crear modelos muy capaces, ponerlos a trabajar en paralelo y usarlos para entrenar en seguridad al modelo siguiente.

Qué propone: de un acuerdo entre laboratorios a una autoridad tipo CERN

Como primer paso, Coxon recomienda que OpenAI y Anthropic, los laboratorios occidentales líderes, lleguen a un acuerdo neutral para no embarcarse de inmediato en la automejora recursiva, es decir, usar IA para crear nuevos sistemas de IA, durante el próximo año. El problema de una pausa, admite, es China: sin ese país cualquier freno queda incompleto.

A largo plazo plantea coordinación entre grandes potencias, incluidas EE UU y China, y una regulación internacional del ritmo. Entre las ideas que menciona está una institución internacional similar al CERN y trabajos de predicción como AI 2040, sucesor de AI 2027. Su argumento es que las computadoras que ejecutan IA deberían tratarse como un recurso peligroso, igual que se rastrea quién tiene material nuclear.

Anthropic responde y OpenAI no comenta

«Siempre hemos sido transparentes al indicar que la IA traerá consigo tanto enormes beneficios como riesgos sin precedentes», declaró un portavoz de Anthropic a WIRED, que citó el trabajo previo de la empresa en métodos de seguridad. «Este trabajo es también la razón por la que creemos que el mundo se beneficiaría de que el sector adoptara una forma legal y verificable de colaborar para regular el ritmo al que lanzamos modelos potentes». OpenAI no respondió a la solicitud de comentarios.

Sobre su antigua empleadora, Coxon la describe como el actor más responsable del sector, con una diferencia grande frente a OpenAI en la seriedad con la que se toma la situación. Contó que en Anthropic los directivos hacen predicciones concretas y debaten la estrategia con toda la plantilla, y que el ambiente se parece al de un mini Proyecto Manhattan, aunque sin mandato gubernamental. Aun así, cree que ninguna empresa privada debería llevarlo adelante. «Cuando las cosas se aceleren el año que viene, tendrán que [tomar atajos] si quieren seguir siendo competitivos», dijo. Según su respuesta, Anthropic todavía no está tomando atajos. La propia empresa pide en público que se la regule, y Coxon lee esa postura como un síntoma del miedo a la carrera en la que está metida.

Los beneficios que Coxon no descarta

El investigador también habló de lo que se gana. Dijo que no es exageración pensar que la IA podría curar el cáncer y mencionó el revuelo por las ecuaciones de Navier-Stokes, el problema matemático que OpenAI dijo haber resuelto y que matemáticos cuestionaron. Si la tecnología funciona como se espera, el mundo podría entrar en una etapa de abundancia. El riesgo es lanzarse demasiado rápido hacia la automejora y perder esa oportunidad.

Sobre sus colegas de Anthropic, contó que muchos están genuinamente contentos de que su mensaje haya tenido tanta repercusión, incluso cuando los critica. Los describió como un grupo bienintencionado, interesante y un poco raro.

Qué hará Coxon ahora

De momento piensa hacer un balance independiente de la situación, en la línea de AI 2027 y AI 2040, dos predicciones elaboradas por investigadores externos a los grandes laboratorios. Si el sector no parece encaminarse a la superación recursiva, evaluaría sumarse a una agencia de auditoría o a un organismo regulador o de transparencia.

Su mensaje original puede consultarse en su publicación en X.

Con información de WIRED.

Comunidad Arepa

Únete a nuestros canales principales

Comentarios

Relacionados

Ver más