Un modelo de mundo es un sistema de inteligencia artificial que aprende cómo se comporta un entorno para poder predecir qué pasará a continuación, también cuando algo o alguien actúa sobre él. Google DeepMind lo define así: sistemas que usan lo que entienden del mundo para simular partes de él, de modo que un agente pueda prever cómo evolucionará un entorno y cómo le afectarán sus propias acciones1.
La diferencia con ChatGPT está en lo que se predice. Un modelo de lenguaje calcula la siguiente palabra; un modelo de mundo intenta calcular el siguiente estado de una escena: dónde estará la pelota dentro de medio segundo o qué pasa si el robot empuja el vaso. Detrás hay tres cosas bastante distintas que comparten nombre, más de 2.000 millones de dólares levantados en solo dos rondas de 2026 y, por ahora, ningún producto pensado para el día a día de una pyme.
Qué es un modelo de mundo, con un ejemplo de béisbol
Los primeros resultados en español para esta búsqueda explican el concepto con el mismo ejemplo. Un bateador tiene milisegundos para decidir. No le da tiempo a calcular la trayectoria de la pelota de forma consciente: su cerebro ya lleva dentro una simulación de cómo vuelan las pelotas, predice dónde estará y el cuerpo reacciona2.
Un modelo de mundo intenta darle eso a una máquina. Se resume en tres capacidades: comprimir lo que entra por los sensores (imágenes, vídeo, movimiento) en una representación sencilla, predecir estados futuros a partir de lo que ya ha visto y simular distintas acciones para quedarse con la mejor3.
Esa tercera capacidad explica el interés de la industria. Un sistema que puede «imaginar» qué pasa si gira a la izquierda, sin girar de verdad, permite ensayar en simulación antes de probar en el mundo real, donde un error rompe cosas.
No es una idea nueva: el agente que aprendió dentro de su propio sueño
El concepto viene de Kenneth Craik, uno de los pioneros de la ciencia cognitiva, y que quedó en segundo plano durante años hasta que las redes neuronales actuales lo han devuelto al centro2.
El momento en que el término entró en la IA moderna tiene fecha: marzo de 2018, cuando David Ha y Jürgen Schmidhuber publicaron un artículo titulado precisamente World Models. Su modelo aprendía una versión comprimida de un videojuego sencillo y, con ella, entrenaban a un agente. Lo llamativo fue esto: consiguieron entrenar al agente entero dentro del «sueño alucinado» que generaba el propio modelo y luego trasladar lo aprendido al entorno real4. Aquel experimento cabía en un videojuego sencillo; hoy la misma idea se aplica a coches y robots.
Tres cosas distintas con el mismo nombre
En los resultados que he revisado para esta búsqueda, ninguno separa lo siguiente. Cuando lees «modelo de mundo» en un titular, puede referirse a sistemas que hacen cosas muy diferentes. En junio de 2026, Fei-Fei Li, cofundadora de World Labs, publicó un ensayo para poner orden, y los separa según lo que devuelven5:
| Tipo | Qué devuelve | Ejemplos | Para qué sirve |
|---|---|---|---|
| Renderizador | Imágenes pensadas para ojos humanos | Genie 3 (Google DeepMind) | Crear y recorrer mundos: videojuegos, contenido visual |
| Simulador | Un estado fiel del mundo: geometría, física, movimiento | Waymo World Model, NVIDIA Cosmos | Entrenar coches y robots ante situaciones raras |
| Planificador | Acciones: qué hacer a continuación | V-JEPA 2 (Meta), modelos de visión-lenguaje-acción | Que un robot coja, mueva o coloque objetos |
Los tres tipos y su definición son del ensayo de Fei-Fei Li. Colocar a Waymo, Cosmos y V-JEPA 2 en cada casilla es lectura mía a partir de esas definiciones.
Los renderizadores son los que salen en los vídeos virales. Genie 3, de Google DeepMind, genera un entorno fotorrealista a partir de una frase y te deja recorrerlo en tiempo real a 20-24 imágenes por segundo y 720p, con coherencia durante varios minutos y memoria de lo que has cambiado durante hasta un minuto6. Lo que se le pide es que parezca real a ojos humanos; la exactitud física queda en segundo plano.
Los simuladores buscan que la geometría y la física cuadren. El caso más claro es el Waymo World Model, que Waymo presentó en febrero de 2026 construido sobre Genie 3: genera escenarios de conducción con cámara y lidar (el sensor láser que mide distancias) para entrenar a sus coches ante situaciones que su flota casi nunca ve, desde un tornado hasta un elefante en la calzada. Que parta de un renderizador no es contradictorio: Waymo lo adapta para que devuelva datos de sensores útiles para su sistema de conducción, que es lo que lo convierte en simulador. Waymo lleva cerca de 200 millones de millas (unos 320 millones de kilómetros) en conducción totalmente autónoma y miles de millones en mundos virtuales7. NVIDIA juega en la misma liga con Cosmos, una familia de modelos abiertos que presentó en el CES de 2025 para generar vídeo con base física para robots y vehículos autónomos8.
Los planificadores devuelven decisiones. V-JEPA 2, de Meta, se entrenó con más de un millón de horas de vídeo y, añadiendo solo 62 horas de datos de robots, sirvió para planificar movimientos de un brazo robótico. Coger y colocar objetos que no había visto, en entornos nuevos, le salió bien entre el 65 % y el 80 % de las veces9.
La distinción importa porque cambia qué preguntar. De un renderizador interesa si engaña al ojo; de un simulador, si se equivoca en la física; de un planificador, si el robot acaba haciendo la tarea. Fei-Fei Li cree que acabarán fusionándose en un único modelo que haga las tres cosas5, pero hoy son productos separados.
El debate de fondo: ¿no bastaba con ChatGPT?
No todo el mundo cree que haga falta algo nuevo. Geoffrey Hinton e Ilya Sutskever sostienen que los grandes modelos de lenguaje ya incorporan representaciones del mundo. Yann LeCun, que fue director científico de IA en Meta, piensa lo contrario: están limitados por el lenguaje y «no pueden predecir las consecuencias de sus acciones»2.
LeCun no se ha quedado en la opinión. Tras dejar Meta fundó AMI Labs, con sede en París, que en marzo de 2026 anunció una ronda de 1.030 millones de dólares con una valoración previa de 3.500 millones, con NVIDIA, Samsung o Toyota Ventures entre los inversores. Su apuesta es JEPA, una arquitectura que aprende a predecir representaciones abstractas del mundo en lugar de generar píxeles o palabras. Su consejero delegado, Alexandre LeBrun, avisa de que pasar de la teoría a aplicaciones comerciales puede llevar años10. El propio LeCun calculaba en 2025 que faltaba «al menos una década» para tener modelos de mundo como él los imagina3.
Del otro lado, Google DeepMind y OpenAI apuestan por alimentar sus modelos con suficientes datos de vídeo y simulaciones 3D3. Recuerda a la discusión de siempre sobre si basta con más datos y modelos más grandes; el contexto de cómo aprenden estos sistemas está en qué es machine learning y dónde encajan los LLM.
Dónde está el dinero, y qué busca la gente en España
Dos rondas marcan 2026. En febrero, World Labs, la empresa de Fei-Fei Li, anunció 1.000 millones de dólares con Autodesk, AMD, NVIDIA o Fidelity entre los inversores; su producto, Marble, crea mundos 3D persistentes a partir de imágenes, vídeo o texto11. Un mes después llegó la de AMI Labs. Entre las dos pasan de 2.000 millones.
La bolsa también se ha dado por enterada. El 29 de enero de 2026 Google abrió Project Genie, el prototipo para crear mundos con Genie 3, a los suscriptores de su plan AI Ultra en Estados Unidos12. Al día siguiente, en plena sesión, Unity caía un 12 %, Roblox un 8 % y Take-Two un 7 %, según Investing.com, que lo relaciona directamente con el lanzamiento de Google13.
Para este artículo he mirado cuánto se busca todo esto en Google España, con los datos del Planificador de palabras clave de Google Ads14. «Modelos de mundo» aparece con 10 búsquedas al mes (el tramo más bajo que da la herramienta) y «world models» ronda las 260, mientras que «genie 3» tiene una media de 3.600. Se busca mucho más el producto que sale en los vídeos que la idea que hay detrás, y los picos coinciden con los lanzamientos:
Búsquedas mensuales de «genie 3» en Google, España. Fuente: Google Ads vía DataForSEO, consultado el 13-09-202614.
El salto a 14.800 búsquedas en febrero llega justo después de que Project Genie se abriera en Estados Unidos, aunque desde España no se podía usar. El repunte de mayo coincide con el anuncio de que se extendía de forma gradual a los suscriptores de AI Ultra de todo el mundo15. Pasado el ruido, en verano la cifra vuelve a unos cientos al mes.
Qué cambia para un autónomo o una pyme (de momento)
Poco. Todos los ejemplos de este artículo apuntan a coches autónomos, robótica o creación de mundos virtuales. No hay uno que te ayude a llevar la contabilidad o a posicionar tu web.
Lo que sí existe hoy, con límites:
- Project Genie exige una suscripción de pago a Google AI Ultra (Google la cita como la de 200 dólares en su anuncio de mayo), ser mayor de edad, y la función de recrear lugares reales con Street View solo cubre sitios de Estados Unidos15. DeepMind reconoce además que Genie 3 aguanta pocos minutos de interacción seguida, escribe mal los textos dentro de la escena y no reproduce lugares reales con precisión1.
- Marble, de World Labs, genera mundos 3D a partir de una foto o un texto11. Para quien trabaja con contenido visual —diseño o arquitectura, por ejemplo— puede servir para bocetar un espacio. Para captar clientes no está pensado.
Y hay pegas de fondo: necesitan muchísima potencia de cálculo, cuestan una fortuna en energía y pueden alucinar o heredar los sesgos de sus datos, igual que un chatbot3. Y cuando quien se equivoca es un robot o un coche, el error ocurre en el mundo físico. Si te interesa esa parte, la cuento en los riesgos de la IA que de verdad te tocan.
Mi lectura: si esto te llega, será de forma indirecta, a través de productos de empresas mucho más grandes que la tuya. Merece la pena entender el término para no tragarse el siguiente titular que llame «modelo de mundo» a cualquier generador de vídeo. Pagar hoy por probarlo solo tiene sentido si trabajas con 3D o videojuegos.
Para seguir tirando del hilo:
- Qué es machine learning — la jerarquía IA, ML, deep learning y LLM, para situar dónde encaja todo esto.
- Qué es un agente de IA — los modelos de mundo existen, sobre todo, para que los agentes aprendan a actuar.
- Qué es ChatGPT, explicado sin rodeos — el modelo de lenguaje con el que se compara siempre.
- Quién mueve la inteligencia artificial — las empresas y personas detrás de la carrera.
- Recursos — vídeos, papers y leaderboards sobre IA que sigo.
Preguntas rápidas
¿Qué es un modelo de mundo en IA? Un sistema que aprende cómo se comporta un entorno para predecir qué pasará a continuación, también cuando un agente actúa sobre él.
¿En qué se diferencia de un LLM como ChatGPT? El LLM predice la siguiente palabra; el modelo de mundo, el siguiente estado de una escena. Hinton y Sutskever creen que los LLM ya llevan dentro una representación del mundo; LeCun, que no.
¿Qué son los world models de Yann LeCun? Modelos basados en JEPA, que predicen representaciones abstractas en lugar de píxeles. Los desarrolla AMI Labs, su empresa en París, que levantó 1.030 millones de dólares en marzo de 2026.
¿Qué es Genie 3? El modelo de Google DeepMind que genera mundos fotorrealistas que se pueden recorrer en tiempo real a partir de un texto. Se prueba a través de Project Genie.
¿Se puede probar en España? Sí, si pagas Google AI Ultra: desde mayo de 2026 Project Genie se está extendiendo de forma gradual a los suscriptores de Google AI Ultra de todo el mundo, mayores de 18 años. Lo de recrear lugares reales con Street View, por ahora, solo en Estados Unidos.
Fuentes
- Google DeepMind, «Genie 3: A new frontier for world models», 5 de agosto de 2025 — definición de modelo de mundo («AI systems that can use their understanding of the world to simulate aspects of it, enabling agents to predict both how an environment will evolve and how their actions will affect it») y limitaciones: espacio de acciones reducido, varios agentes, lugares reales, texto y «a few minutes of continuous interaction». deepmind.google
- BBVA, «Los modelos de mundo, una forma de interpretar y predecir el mundo para la IA», 21 de mayo de 2026 — ejemplo del bateador, Kenneth Craik, posturas de Hinton, Sutskever y LeCun. bbva.com
- Antonio Vallejo, Xataka, «Los "modelos de mundo" apuntan a ser la próxima gran revolución de la IA», 20 de octubre de 2025 — las tres capacidades, la estimación de LeCun («al menos una década»), las apuestas de DeepMind y OpenAI y las limitaciones de cálculo, coste y alucinaciones. xataka.com
- David Ha y Jürgen Schmidhuber, «World Models», arXiv:1803.10122, 27 de marzo de 2018 — «We can even train our agent entirely inside of its own hallucinated dream generated by its world model, and transfer this policy back into the actual environment». arxiv.org
- Fei-Fei Li, «A Functional Taxonomy of World Models», 3 de junio de 2026 — renderer, simulator y planner, y la convergencia hacia «a unified world model». drfeifei.substack.com
- Google DeepMind, ficha de Genie 3 — «20-24 frames per second», «720p resolution», consistencia de «several minutes» y memoria de interacciones «for up to a minute». deepmind.google
- Waymo, «The Waymo World Model: A New Frontier For Autonomous Driving Simulation», 6 de febrero de 2026 — construido sobre Genie 3, salidas de cámara y lidar, escenarios raros (tornado, elefante), «nearly 200 million fully autonomous miles» y «billions of miles in virtual worlds». waymo.com
- NVIDIA Newsroom, «NVIDIA Launches Cosmos World Foundation Model Platform to Accelerate Physical AI Development», enero de 2025 (CES) — modelos generativos de mundo con licencia abierta para robots y vehículos autónomos. nvidianews.nvidia.com
- Meta AI, «V-JEPA 2», 11 de junio de 2025 — «more than 1 million hours of video», «only 62 hours of robot data» y «success rates of 65% – 80% for pick-and-placing new objects in new and unseen environments». ai.meta.com
- TechCrunch, «Yann LeCun's AMI Labs raises $1.03B to build world models», 9 de marzo de 2026 — 1.030 millones de dólares, valoración previa de 3.500 millones, sede en París, inversores, JEPA y la advertencia de Alexandre LeBrun sobre los plazos. techcrunch.com
- World Labs, «World Labs Announces New Funding», 18 de febrero de 2026 — «World Labs has raised $1 billion in new funding», inversores y descripción de Marble. worldlabs.ai
- Google, «Project Genie: AI world model now available for Ultra users in U.S.», 29 de enero de 2026. blog.google
- Investing.com, «Unity stock falls alongside Take-Two, Roblox after Google's Project Genie launch», 30 de enero de 2026 — caídas del 12 % (Unity), 8 % (Roblox) y 7 % (Take-Two) en la sesión, en el momento de la publicación. investing.com
- Datos propios: consulta a DataForSEO, endpoint Google Ads Search Volume (datos del Planificador de palabras clave de Google Ads), ubicación España, idioma español, 13 de septiembre de 2026. Volumen medio mensual: «modelos de mundo» 10, «world models» 260, «genie 3» 3.600. Serie mensual de «genie 3» de septiembre de 2025 a agosto de 2026: 2.900, 1.300, 1.000, 590, 6.600, 14.800, 1.300, 880, 6.600, 1.600, 720 y 590. docs.dataforseo.com
- Google, «Simulate real-world places with Project Genie and Street View», 19 de mayo de 2026 — «gradually rolling out to all eligible Google AI Ultra $200 subscribers globally (18+)»; Street View solo para lugares de EE. UU. por ahora. blog.google