Open Dreamer publica una reproducción abierta del modelo mundial Dreamer 4
El equipo Reactor liberó Open Dreamer, una implementación abierta en JAX y Flax NNX que reproduce buena parte del flujo de trabajo de Dreamer 4, con tokenizador de video, dinámica latente condicionada por acciones, generación de recorridos y una demostración en Minecraft.

Open Dreamer es una implementación abierta del modelo mundial Dreamer 4 desarrollada por el equipo de investigadores Reactor con JAX y Flax NNX. El proyecto publica el código de entrenamiento, herramientas de inferencia y una demostración que alterna entre una partida real de Minecraft y un entorno generado por el modelo, aunque todavía no incluye el ciclo completo de aprendizaje por imitación y refuerzo.
El equipo de investigadores Reactor presentó Open Dreamer, una reproducción abierta del flujo de trabajo de Dreamer 4 orientada a modelos mundiales capaces de anticipar la evolución de un entorno a partir de videos, estados latentes y acciones. La propuesta fue desarrollada con JAX y Flax NNX, dos herramientas muy utilizadas para entrenar modelos de aprendizaje profundo a gran escala, y busca ofrecer una implementación reproducible de los componentes centrales descritos en la investigación original.
Según Fuente original, la información se basa en Meet Open Dreamer: A JAX/Flax Reproduction of the Dreamer 4 World Model Pipeline, With the Full Training Recipe Published.
El lanzamiento no se limita a una demostración visual. Incluye repositorios con código de entrenamiento e inferencia, configuraciones concretas para escenarios de videojuego y una experiencia en navegador que transmite un mundo generado de Minecraft en tiempo real. Aun así, el material publicado tiene límites importantes: no incorpora el bucle completo de aprendizaje por comportamiento ni el entrenamiento mediante refuerzo del agente Dreamer 4.
Dos repositorios para separar entrenamiento e inferencia
La arquitectura pública se distribuye principalmente en dos repositorios. next-state/open-dreamer concentra el flujo de entrenamiento y reúne el tokenizador causal de video, el modelo de dinámica latente condicionado por acciones, la generación de recorridos y las herramientas para calcular la métrica FVD, utilizada para evaluar la calidad de videos generados.
El segundo repositorio, reactor-team/open-dreamer, ofrece un entorno local más pequeño para inferencia. Su función es recibir un archivo MP4 junto con un archivo de acciones compatible y generar nuevos cuadros a partir de esa secuencia. Esta separación resulta útil para quienes quieran estudiar el entrenamiento completo y para quienes solo necesiten probar el modelo sin preparar toda la infraestructura.
También existe una demostración alojada sobre la infraestructura de Reactor. El navegador muestra un mundo de Minecraft generado en tiempo real y permite alternar entre el juego original y el modelo mundial mediante un control que transfiere la transmisión cuadro por cuadro. La experiencia sirve para observar hasta qué punto el sistema conserva la continuidad visual y la relación entre las acciones del jugador y los estados futuros del entorno.
De CoinRun a Minecraft: una estrategia de desarrollo progresiva
El equipo no comenzó directamente con el escenario más exigente. La primera etapa se realizó sobre CoinRun, un videojuego de plataformas bidimensional generado de forma procedural. Ese entorno puede entrenarse con una sola GPU y permite evaluar con mayor rapidez la tokenización de imágenes, la predicción temporal y el comportamiento de los recorridos simulados.
Una vez que el flujo de trabajo funcionó en ese contexto, los investigadores lo llevaron a videos de juego similares a los utilizados por VPT, el sistema conocido por aprender interacciones en Minecraft a partir de demostraciones humanas. Esta progresión reduce el espacio de búsqueda y permite detectar problemas de arquitectura, datos y estabilidad antes de invertir recursos en un modelo de mayor tamaño.
El objetivo declarado fue reproducir las decisiones de Dreamer 4 sin sumar técnicas ajenas al trabajo de referencia. Esa restricción es relevante porque evita que el resultado dependa de una combinación difícil de auditar de métodos alternativos. Open Dreamer no pretende presentar una arquitectura completamente nueva, sino documentar con precisión cómo construir y entrenar una versión abierta del enfoque.
Un mismo transformador para comprimir imágenes y predecir estados
Tanto el tokenizador como el modelo de dinámica utilizan una columna vertebral basada en un transformador con causalidad por bloques. El diseño alterna dos clases de atención. Las capas espaciales conectan los elementos que pertenecen a un mismo cuadro, mientras que las capas temporales causales relacionan diferentes momentos de la secuencia.
La separación permite que el modelo procese información visual dentro de cada instante y, al mismo tiempo, aprenda cómo cambia el entorno cuando transcurre el tiempo. En un sistema de este tipo, la compresión es fundamental: trabajar con todos los píxeles originales de un video haría que el costo de memoria y cómputo creciera rápidamente.
Un tokenizador enmascarado en lugar de un VAE
Open Dreamer utiliza un autoencoder enmascarado basado en transformadores, conocido como MAE, y no un autoencoder variacional. El equipo informa una compresión aproximada de cien veces y señala que este enfoque no necesita una pérdida KL ni una pérdida adversarial. La máscara obliga al modelo a reconstruir partes ausentes del cuadro, una decisión que, según los investigadores, favorece un espacio latente más adecuado para los procesos de difusión.
En la configuración de Minecraft, cada cuadro produce 512 tokens latentes con un ancho de cuello de botella de 16. Las imágenes originales de 360 por 640 píxeles se rellenan hasta 368 por 640 para que ambas dimensiones puedan dividirse en parches de 16 por 16. El codificador tiene 12 capas con una dimensión de modelo de 1536, mientras que el decodificador utiliza ocho capas con una dimensión de 1024.
La probabilidad de enmascaramiento llega hasta 0,9. Además, la métrica LPIPS se aplica con un peso de 0,2 en la mitad de los pasos temporales. Este detalle muestra que la reconstrucción no se evalúa únicamente mediante diferencias píxel a píxel, sino también con una medida perceptual orientada a conservar características visuales relevantes.
Cómo el modelo relaciona acciones, políticas y estados futuros
El modelo de dinámica predice el cuadro siguiente y utiliza una combinación de forzado por difusión, coincidencia de flujos y modelos de atajo. También anticipa la acción siguiente. En lugar de separar por completo un módulo de transición y otro de política, el recorrido se organiza en bloques por instante temporal que contienen la acción previa, el estado y la política.
La atención espacial opera dentro de cada bloque, mientras que la atención temporal causal conecta los bloques a lo largo de la secuencia. Una restricción central es que los tokens del modelo mundial no pueden leer directamente el token del agente. Por lo tanto, la información vinculada con la tarea y la política solo puede afectar los estados futuros mediante la próxima acción. Esta decisión reduce el riesgo de que el modelo reciba información privilegiada sobre el agente y ayuda a preservar una separación clara entre observación, decisión y consecuencia.
Las acciones de VPT se representan mediante 27 canales binarios y 121 clases categóricas para el mouse. No se utilizan canales continuos. La codificación permite expresar movimientos y acciones discretas del juego, aunque también condiciona el tipo de interacción que puede modelarse de forma directa.
La escala técnica de la configuración para Minecraft
La configuración publicada para la dinámica latente utiliza un modelo de 1.600 millones de parámetros, con 30 capas de causalidad por bloques, una dimensión de modelo de 1.920 y 30 cabezas de atención. Tres cabezas se destinan a claves y valores compartidos mediante atención de consultas agrupadas, una técnica que ayuda a reducir el costo de memoria durante la inferencia.
Cada instante incorpora 32 tokens de registro aprendidos. El parámetro de empaquetado agrupa latentes vecinos del tokenizador dentro de cada token espacial de dinámica. La atención temporal se ejecuta sobre una ventana deslizante de 192 pasos, lo que limita el historial activo y permite controlar el uso de memoria cuando las secuencias son extensas.
El entrenamiento está configurado para 200.000 pasos con el optimizador Muon, un calendario WSD y una tasa de aprendizaje máxima de 3 por 10-4. Las muestras de atajo y arranque progresivo comienzan en el paso 100.000 y representan el 25% del lote. La media móvil exponencial utiliza una decaída de 0,999, una configuración que el equipo considera importante para la inferencia basada en difusión.
La estabilidad fue un problema más difícil que la pérdida
Uno de los aportes más útiles del proyecto es la documentación de los inconvenientes encontrados durante el entrenamiento. Los investigadores explican que muchos problemas aparecen aunque la pérdida continúe descendiendo. En otras palabras, una mejora constante del error cuadrático medio no garantiza que los videos generados sean visualmente mejores ni que los recorridos mantengan coherencia.
Entre las correcciones aplicadas, Muon reemplazó a LaProp después de que este último presentara picos aleatorios con una frecuencia creciente. El equipo menciona dos ejecuciones de aproximadamente 400 horas de B200 cada una al analizar ese comportamiento. También considera obligatorias las ponderaciones EMA para la inferencia con difusión.
La precisión mixta se configuró con límites específicos. Los parámetros permanecen en precisión de 32 bits, mientras que la mayoría de las activaciones de multiplicación de matrices y las entradas de atención utilizan BF16. La normalización y la salida de flujo de la dinámica se mantienen en 32 bits. Esta combinación busca equilibrar velocidad, consumo de memoria y estabilidad numérica.
El equipo también probó una formulación de predicción x con una pérdida en el espacio v. El resultado equivale a un término de ponderación parecido al de Dreamer 4, aunque con un denominador elevado al cuadrado, y produjo una mejora pequeña pero perceptible. Además, el transporte óptimo barycéntrico entre lotes de ruido y secuencias latentes ayudó a estabilizar la generación de recorridos. La μ-parametrización fue evaluada, pero no se consideró necesaria, en parte porque Muon mantuvo más constantes los hiperparámetros entre modelos de distintos tamaños.
Memoria, rendimiento y preparación de los datos
El equipo informa una utilización de entre el 57% y el 58% de las operaciones de punto flotante del modelo, frente a un valor de referencia cercano al 60% para un entrenamiento saludable de transformadores. La explicación se apoya en un análisis de techo de rendimiento: en una B200, el punto de cruce entre una carga limitada por el ancho de banda y otra limitada por el cómputo se sitúa en 292 FLOP por byte. Procesar 256 cuadros por GPU lleva el trabajo por encima de ese umbral.
La distribución de parámetros arrojó un resultado contraintuitivo. El estado completo del modelo de 1.600 millones de parámetros, incluidos parámetros, gradientes, estados del optimizador y EMA, ocupó aproximadamente 24 GiB y pudo entrar en una B200. El problema principal fueron las activaciones. Después de probar paralelismo de datos, FSDP, paralelismo tensorial y paralelismo de secuencia, el equipo eligió paralelismo de datos convencional junto con checkpointing de activaciones.
La carga de datos también exigió una solución específica. La decodificación directa con FFmpeg no era lo suficientemente rápida para mantener ocupadas las GPU. Por eso, el conjunto completo se tokenizó previamente en archivos .arrayrecord y luego se utilizó Grain con un búfer de precarga ubicado en la GPU. El caso demuestra que el rendimiento final no depende únicamente del tamaño del modelo: el almacenamiento, la decodificación y la alimentación de los aceleradores pueden convertirse en cuellos de botella decisivos.
Qué queda fuera del lanzamiento y qué se puede evaluar
Open Dreamer no publica el ciclo de aprendizaje por comportamiento ni el entrenamiento por refuerzo que completarían un agente Dreamer 4. El trabajo de políticas realizado durante la fase de CoinRun tampoco se utilizó para Minecraft ni fue liberado. Por esa razón, el proyecto debe entenderse como una reproducción del modelo mundial y de su capacidad de generar estados futuros, no como un agente autónomo completo listo para resolver tareas abiertas.
Otro límite está relacionado con la evaluación. Aunque el repositorio incluye scripts/eval_fvd.py, con un sistema basado en I3D configurado para cuatro cuadros de contexto y un horizonte de 240 cuadros, el artículo no publica puntuaciones FVD. Sin esos valores, resulta difícil comparar cuantitativamente el resultado con otras implementaciones o establecer cuánto se acerca a la referencia original.
La ausencia de una métrica publicada no invalida el código, pero obliga a interpretar la demostración con prudencia. Una secuencia visual convincente puede esconder errores de causalidad, acumulación de artefactos o pérdida de control a lo largo de recorridos extensos. Para evaluar el sistema en profundidad será necesario ejecutar el repositorio con datos comparables y medir tanto la calidad de los cuadros como la fidelidad de las consecuencias de cada acción.
El repositorio de Open Dreamer puede ampliar la investigación aplicada
La publicación tiene implicancias concretas para laboratorios, universidades y equipos que investigan agentes de inteligencia artificial. Al contar con una receta de entrenamiento detallada, configuraciones de hardware y decisiones sobre precisión, memoria y estabilidad, los desarrolladores pueden reproducir partes del proceso sin depender exclusivamente de descripciones generales de un artículo académico.
También ofrece un punto de partida para estudiar videojuegos, simuladores y entornos interactivos en los que las acciones no solo producen una respuesta inmediata, sino que modifican los estados posteriores. En sectores como robótica, automatización o entrenamiento virtual, los modelos mundiales podrían utilizarse para anticipar escenarios antes de ejecutar una acción sobre el sistema real. Sin embargo, trasladar los resultados de Minecraft a esos ámbitos exigiría datos específicos, controles de seguridad y evaluaciones mucho más estrictas.
Desde la perspectiva de los negocios digitales, el proyecto refuerza una tendencia relevante para quienes trabajan con inteligencia artificial y posicionamiento web: los modelos abiertos no solo compiten por responder consultas, también buscan representar entornos, simular resultados y asistir decisiones. Las empresas que desarrollen productos basados en simulación deberán prestar atención a la trazabilidad de los datos, al costo de inferencia y a la diferencia entre una demostración visual y una capacidad operativa confiable.
En términos de visibilidad orgánica, una implementación técnica de este nivel genera interés por la combinación de nombres propios, repositorios, configuraciones y casos de uso. Para un sitio especializado, cubrir el proyecto con precisión implica explicar qué está disponible, qué no fue publicado y cómo se puede reproducir, en lugar de presentar la demostración como evidencia de un agente general. Esa distinción mejora la utilidad para lectores técnicos y evita promesas que el código todavía no permite sostener.
La información original sobre el lanzamiento, sus repositorios y la demostración fue publicada por MarkTechPost. Open Dreamer queda así como una base abierta para estudiar modelos mundiales reproducibles: suficientemente detallada para experimentar con tokenización, dinámica y generación de recorridos, pero todavía incompleta para considerarla una implementación integral de un agente Dreamer 4.
Preguntas frecuentes
¿Qué es Open Dreamer?
Open Dreamer es una implementación abierta del flujo de trabajo del modelo mundial Dreamer 4, desarrollada por el equipo Reactor con JAX y Flax NNX. Incluye tokenización de video, predicción de estados latentes, generación de recorridos y evaluación mediante FVD.
¿Open Dreamer incluye un agente completo para jugar Minecraft?
No. El lanzamiento cubre principalmente el modelo mundial y sus herramientas de entrenamiento e inferencia. El ciclo completo de aprendizaje por comportamiento y aprendizaje por refuerzo figura como una tarea pendiente del proyecto.
¿Qué hardware se utilizó para entrenar el modelo?
La configuración publicada está orientada a aceleradores B200. El equipo informa que el estado del modelo de 1.600 millones de parámetros ocupó aproximadamente 24 GiB, mientras que las activaciones fueron el principal costo de memoria.
Más noticias de este autor
Seguimiento del tema
Esta cobertura puede ampliarse con nuevas fuentes, consultas de búsqueda y artículos relacionados dentro del mismo eje editorial.




Lo más interesante no es solo que hayan abierto el código, sino que permita medir qué tan cerca está de Dreamer 4 en escenarios concretos. Me gustaría ver comparativas de latencia, consumo de GPU y estabilidad de las trayectorias en Minecraft. Si los resultados son reproducibles, puede ser una base enorme para experimentar sin depender de una caja negra.
Está buenísimo que hayan liberado una implementación abierta y no solo una demo cerrada. La parte de Minecraft sirve bastante para entender qué tan bien aprende el modelo la dinámica del entorno, aunque me queda la duda de qué hardware hace falta para correrlo de manera fluida. Ojalá aparezcan pronto benchmarks comparables con Dreamer 4. También suma leerlo junto con otro contenido del cluster editorial.