Los riesgos de la IA se han partido esta semana en dos escalas muy distintas, y conviene no mezclarlas. El 8 de septiembre de 2026, Jacob Coxon —investigador que pasó casi tres años en OpenAI y un mes en Anthropic— dimitió en público acusando a las dos empresas de correr «hacia la superinteligencia autorrecursiva apostando nuestras vidas»1. Evan Hubinger, responsable de Alignment Science en Anthropic, le dio la razón en público. Alignment Science es el equipo que intenta que un modelo haga lo que se pretende que haga, y no otra cosa: Hubinger añadió una cifra propia, más de un 10 % de probabilidad de que la IA acabe con la humanidad esta década2. Es un riesgo real, y hay gente seria ocupándose de él. Pero no es el riesgo de la IA que decide si a ti, esta semana, usarla te sale bien o mal —ese es mucho más aburrido: que nadie comprueba lo que escribe o decide sola.

Lo sé porque llevo once días midiéndolo de primera mano.

Por si no lo conoces: desde el 30 de agosto hay cuatro modelos de IA —Claude, GPT, Gemini y DeepSeek— gestionando cada uno su propia web, publicando artículos solos y compitiendo por conseguir suscriptores con SEO, sin que ninguna persona revise lo que escriben antes de que salga publicado. Se llama AI SEO Battle, y cada decisión queda registrada en abierto5. Ya conté el planteamiento del experimento en su momento; no lo menciono aquí como anuncio, sino porque es la fuente de los números de este artículo.

Qué dijo Coxon, y por qué Hubinger le dio la razón

Coxon no es un activista externo a la industria: es matemático de formación, trabajó casi tres años en OpenAI —participó en el entrenamiento de GPT-4o— y pasó después un mes en Anthropic antes de dimitir1. En su mensaje, publicado en X, dijo que dentro de las dos empresas hay gente que cree de verdad que la IA podría matarnos a todos antes de que acabe la década. Hubinger, responsable de Alignment Science en Anthropic, no lo desmintió: dijo que Coxon tenía razón en que esa creencia existe dentro de la empresa, y situó su propia estimación por encima del 10 %2.

Esa cifra no sale de la nada. En 2023, el proyecto AI Impacts encuestó a 2.778 investigadores de aprendizaje automático publicados en revistas de referencia; en la pregunta sobre extinción humana o un desempoderamiento igual de severo, con 1.321 respuestas, la mediana fue del 5 % y la media del 16,2 %3. Hubinger está dentro de ese rango, no fuera de él. Y no es la primera renuncia de este tipo dentro de la misma empresa: en febrero de 2026, Mrinank Sharma, que dirigía el equipo de Safeguards de Anthropic, dimitió con una carta pública en la que decía que «el mundo está en peligro»4.

FuenteEstimación de riesgo existencial
Evan Hubinger (Anthropic, septiembre 2026)Superior al 10 %
AI Impacts, encuesta a 2.778 investigadores (2023) — media16,2 %
Misma encuesta — mediana5 %

La pregunta de la encuesta de AI Impacts es equivalente a la que responde Hubinger: probabilidad de extinción humana o de un desempoderamiento severo y permanente causado por la IA.

Los otros riesgos de la IA: los que no salen en las noticias

Ninguna de las dos declaraciones anteriores tiene que ver con lo que le puede pasar a un autónomo o una pyme que usa IA este mes. Basta con que alguien deje que un modelo escriba o decida algo y que después nadie lo compruebe; no hace falta superinteligencia ni guion de ciencia ficción. La escala larga —la de Coxon y Hubinger— merece a la gente que la está estudiando, sin condescendencia hacia ellos. La escala corta es la que de verdad se materializa cada semana, y es la que puedo enseñar con datos propios de un experimento real.

Once días de cuatro IAs escribiendo solas

En los primeros once días del experimento —del 30 de agosto al 10 de septiembre— las cuatro IAs ejecutaron 94 turnos autónomos: 80 terminaron bien, y entre las cuatro webs se publicaron 43 artículos, por un coste real de 11,61 $5. Los otros 14 turnos no llegaron a publicar nada, y ahí está el dato que de verdad importa para este artículo: no todos fallaron por lo mismo.

CausaTurnos
Filtro automático de guardarraíles7
Formato de datos no legible (JSON roto)5
Rutas de archivo mal declaradas2
Los 14 turnos que no llegaron a publicar, por causa 7 los paró el filtro de guardarraíles, 5 tuvieron un formato de datos no legible, 2 declararon mal sus rutas de archivo. Los 14 turnos sin publicar, por causa Guardarraíles 7 JSON roto 5 Rutas mal declaradas 2

Lo que paró el filtro automático

De los 7 bloqueos, cuatro fueron por enlazar imágenes de portada que la IA daba por creadas antes de generarlas, uno por enlazar una hoja de estilos que no existía y otro por un tope de cambios diarios que ya se ha retirado. El séptimo es el que de verdad importa aquí: a Claude se le bloqueó un artículo por afirmar que un producto no tenía ningún riesgo. Es exactamente el tipo de afirmación rotunda que un filtro tiene que frenar, y lo frenó sin que nadie interviniera a mano5.

El que nadie habría notado sin mirar el registro

El primer día, Gemini razonó en voz alta —queda escrito en su propio registro— que iba a usar el modelo más potente disponible para su turno. El sistema, al no tener todavía un turno anterior del que partir, le asignó el modelo por defecto: el más barato. Gemini nunca se dio cuenta del cambio, y su primer artículo salió muy por debajo de lo que ella misma esperaba entregar. Ahí no hubo ningún error visible desde fuera, solo una IA convencida de haber hecho una cosa mientras hacía otra.

El error que cometió el propio experimento

El capítulo del blog que cuenta este mismo experimento también se equivocó, y conviene decirlo aquí en vez de dejarlo pasar. Publicado el 8 de septiembre, decía que se habían escrito 33 artículos; la cifra real de esa fecha, contrastada contra los ficheros de cada web y sus fuentes RSS, era 31 (43 a día de hoy). Decía también 3,67 €. La revisión original solo comprobó que la suma cuadraba, y cuadraba —pero la tabla de precios de las cuatro APIs está en dólares, no en euros, según el propio código que calcula el coste: el símbolo que se publicó era el equivocado5.

Las dos cifras venían de una consulta real, no de una invención —y ese es justo el problema. Un número que sale mal de una fuente inventada se nota. Uno que sale mal de una fuente real, pero equivocada, no llama la atención de nadie. Es el mismo patrón que el bloqueo del guardarraíl sobre el producto «sin ningún riesgo»: el fallo que no se presenta como fallo.

Casos reales fuera del experimento

Once días de un experimento no bastan para generalizar nada por sí solos. Fuera de él, el mismo patrón ya tiene historial documentado, y sanciones de por medio.

En Estados Unidos, la jueza Nina Wang sancionó en 2026 a los abogados de Mike Lindell en el caso Coomer v. Lindell con 3.000 $ por presentar unas treinta citas legales defectuosas o directamente inventadas por una IA; al repetirse el error, la sanción subió otros 5.000 $6. El patrón se repite: el jurista Damien Charlotin mantiene una base de datos pública de sentencias donde un tribunal ha confirmado que una de las partes se apoyó en contenido de IA alucinado. A mediados de 2026 ya pasaba de 1.490 casos documentados en todo el mundo, con un ritmo que subió de dos por semana a principios de 2025 a dos o tres al día a finales de ese mismo año7.

Y no hace falta ni siquiera un tribunal. Un estudio de la Universidad de Melbourne con 32.352 personas encuestadas en 47 países encontró que el 66 % de los empleados admite haberse fiado alguna vez de un resultado de IA sin evaluarlo8. Y en marzo de 2025, la empresa solar Wolf River Electric demandó a Google después de que su resumen generado por IA afirmara, sin que fuera cierto, que la compañía estaba siendo investigada por prácticas engañosas: un cliente canceló un contrato de 150.000 $ citando esa afirmación9.

Qué verificar si dejas que una IA decida sola

Nada de esto es un argumento para dejar de usar IA. Es un argumento para dejar de tratar lo que produce como si viniera verificado de fábrica. Con lo que ha dado de sí este experimento y los casos de fuera, esto es lo mínimo que compruebo antes de dar por bueno algo que ha escrito o decidido una IA sin supervisión directa:

  • Cada cifra, contra su fuente primaria — no contra el resumen que la propia IA hizo de esa fuente. El error de los 33 artículos salió de contar en el sitio equivocado, no de inventar nada.
  • Las citas y enlaces, uno a uno — un enlace que apunta a algo que no existe, o una cita judicial que no aparece en ningún repositorio real, es la señal más barata de detectar y la más cara de ignorar.
  • Desconfiar de lo que se presenta como «normal» o «pendiente» — un estado que lleva días sin cambiar puede significar que todo va bien, o que nadie está mirando ahí.
  • Las negaciones rotundas de riesgo — «este producto no tiene ningún riesgo» es exactamente el tipo de frase que hay que revisar dos veces, la haya escrito una persona o una IA.
  • Muestreo real, aunque esté todo automatizado — coger al azar una decisión de cada cierto número y comprobarla entera, no solo por encima.

La escala larga seguirá su curso, y merece a la gente que la está trabajando. La escala corta la decides tú, cada vez que publicas, envías o firmas algo que ha escrito una IA sin haberlo mirado antes con estas cinco cosas en la cabeza. Si quieres verlo aplicado, hablo de qué tareas automatiza de verdad la IA hoy, y explico la base técnica en qué es machine learning.

Preguntas frecuentes

¿Es real que la IA podría acabar con la humanidad? Es una posibilidad que investigadores de seguridad de IA toman en serio: Evan Hubinger la sitúa por encima del 10 % en la próxima década, y una encuesta de 2023 a 2.778 investigadores de aprendizaje automático dio una mediana del 5 % y una media del 16,2 % para ese mismo escenario. No es consenso ni es descartable —es un riesgo de largo plazo, distinto del que le toca hoy a quien usa IA en su trabajo.

¿Cuál es el riesgo real de usar la IA en una pyme o como autónomo? La IA no se rebela: el problema es que nadie comprueba lo que escribe o decide sin supervisión. Un experimento con cuatro IAs publicando solas durante once días registró cifras mal calculadas, un modelo ejecutándose sin que la propia IA lo supiera, y un artículo bloqueado por afirmar sin base que un producto no tenía ningún riesgo. Fuera de ese experimento hay abogados sancionados por citar jurisprudencia inventada por IA y empresas con pérdidas reales por afirmaciones falsas de un sistema de IA.

¿Qué pasa si dejo que una IA escriba o decida algo sin revisarlo? El patrón más caro no es el fallo ruidoso, que se detecta y se arregla solo. Es el que se presenta como normal. Una cifra equivocada sacada de una fuente real pero mal consultada, un estado que lleva días marcado como «pendiente» sin que nadie lo mire, o una negación de riesgo demasiado rotunda son las señales que hay que comprobar antes de dar algo por bueno.

Fuentes

  1. CNBC, "Experts weigh in as researcher says AI has more than 10% chance of 'killing all humans'" — dimisión de Jacob Coxon el 8 de septiembre de 2026, investigador con casi tres años en OpenAI (participó en el entrenamiento de GPT-4o) y un mes en Anthropic; acusa a las dos empresas de correr hacia la superinteligencia autorrecursiva "apostando nuestras vidas". cnbc.com
  2. Xataka, "Están jugando con nuestras vidas: un investigador de Anthropic cree que hay un 10% de posibilidades de que la IA acabe con la humanidad" — declaraciones públicas de Evan Hubinger, responsable de Alignment Science en Anthropic, respaldando a Coxon y estimando una probabilidad superior al 10% de extinción humana por IA en la próxima década. xataka.com
  3. AI Impacts, "2023 Expert Survey on Progress in AI" — encuesta a 2.778 investigadores de aprendizaje automático publicados en revistas de referencia; en la pregunta sobre probabilidad de que la IA cause extinción humana o un desempoderamiento severo permanente, 1.321 respuestas: mediana del 5%, media del 16,2%. blog.aiimpacts.org
  4. Forbes, "Anthropic AI Safety Researcher Warns Of World 'In Peril' In Resignation" — dimisión de Mrinank Sharma, responsable del equipo de Safeguards de Anthropic, el 9 de febrero de 2026. forbes.com
  5. Marcador público del experimento AI SEO Battle, con el registro de cada turno, su coste y su razonamiento. retoseo.com
  6. Reason (blog Volokh Conspiracy), "$5K Sanctions For Repeated Mis-Citation In Coomer v. Lindell" — la jueza Nina Wang sancionó a los abogados de Mike Lindell con 3.000 $ por citas legales defectuosas o inventadas por IA, y con 5.000 $ adicionales al repetirse el error. reason.com
  7. Damien Charlotin, base de datos pública de sentencias con alucinaciones de IA confirmadas por un tribunal — más de 1.490 casos documentados a mediados de 2026. damiencharlotin.com
  8. The Conversation, resumen del estudio de la Universidad de Melbourne (Gillespie y Lockey) sobre confianza en la IA — encuesta a 32.352 personas en 47 países; 66% admite haberse fiado de resultados de IA sin evaluarlos. theconversation.com
  9. Star Tribune, cobertura de la demanda Wolf River Electric v. Google — un resumen generado por IA afirmó falsamente que la empresa estaba siendo investigada por prácticas engañosas; un cliente canceló un contrato de 150.000 $ citando esa afirmación. startribune.com