MARIO WORLD sala de control · el agente juega y aprende aquí mismo
estado: — nivel: — — datos: esperando…
Vista
Vídeo
En directo · flujo MJPEG 256×224 conectando con el chorro de vídeo…
Vídeo en directo del agente jugando a Super Mario World
nivel—
distancia ahora—px
mejor distancia—px
pasos/s—
fotogramas/s del juego—
estado—
Cómo aprende · el ciclo, en vivo esperando el primer parte del agente…
intento actual—
pasos jugados—pasos
ritmo—pasos/s
actualizaciones de la red—

esperando los datos del agente…

esperando intentos con los que medir si mejora…

Aquí no hay generaciones ni población: eso es de los algoritmos genéticos (NEAT). Este agente aprende por gradiente — juega, mide el resultado, corrige los pesos de la red y vuelve a jugar con la red corregida. Los intentos son partidas seguidas, no generaciones.

Curva de aprendizaje · en qué se basa esperando datos…
esperando el primer intento…
rango lupa esperando datos…
Terminal · diario del agente esperando el primer parte…
mario@vps · diario en vivo del agente las líneas nuevas se escriben solas según las publica el propio agente ─────────────────────────────────────────────────────────────
puntos
—
monedas
—
vidas
—
bandera
—
Recompensa por intento —
recompensa del intento media móvil (7 intentos) —
—
Distancia por intento —
distancia del intento (px) mejor distancia hasta ese intento
—
Telemetría del agente todo lo que ves sale de /mario/progreso.json, publicado por el propio agente
pasos totales
—
decisiones tomadas desde el arranque
intentos
—
partidas empezadas
mejor distancia
—
récord global
recompensa media
—
media de los últimos intentos
ritmo
—
pasos por segundo
vídeo del juego
—
fotogramas por segundo (emulador)
tiempo jugado
—
desde el arranque
nivel actual
—
—
Niveles los números son los que publica el agente; lo que no publica sale como «—»
nivelnombreintentosmejor distancia mejor recompensamuertesturno del agente¿superado?
————————
Ficha del agente tal cual lo declara el propio agente en el JSON

Cómo aprende

proyecto
—
emulador
—
política (red)
—
entrada de la red
—
fórmula de recompensa
—
qué está haciendo
—

Hiperparámetros del entrenamiento

Aprende desde cero y sin GPU. No hay una partida pregrabada ni una política copiada: el agente arranca sin saber nada, prueba al azar, cobra la recompensa que él mismo calcula y va subiendo. Sin tarjeta gráfica el progreso es lento, pero es real y se ve en la curva de arriba.