// Curso · IA generativa y agéntica
Un modelo de lenguaje de ajedrez, desde cero.
Trece módulos que construyen un único proyecto: un GPT que aprende a jugar leyendo partidas, se alinea con recompensas que un motor puede verificar, corre en tu navegador y acaba convertido en un entrenador con herramientas.
Un dominio cerrado, datos abiertos, modelos pequeños.
- 01
Verificable
La legalidad y la calidad de cada jugada las decide un motor, no una persona. Eso hace posibles el reward model, DPO y GRPO con recompensas reales y baratas.
- 02
Abierto
Lichess publica miles de millones de partidas, puzles y evaluaciones bajo CC0. No hay que negociar nada ni ocultar de dónde salen los datos.
- 03
Pequeño
Decenas de millones de parámetros: se entrena en horas en una sola GPU y cabe en el navegador. Se puede medir todo y publicarlo todo.
Dos fases, un artefacto.
Cada módulo mejora el mismo modelo o añade una pieza que lo usa. Tu progreso se guarda en este navegador.
Fase 1 · Un modelo de lenguaje de ajedrez desde cero
- M0Taller: repo, entorno, datos y tablero3 hvigente0/1
- M1Del PGN al tensor: datos y tokenización6 hvigente0/1
- M2El decoder: un GPT que juega8 hvigente0/1
- M3El encoder: entender la posición6 hvigente0/1
- M4Fine-tuning e instrucción7 hprevisto—
- M5Alineamiento con recompensas verificables8 hprevisto—
- M6Evaluar, exportar, publicar6 hprevisto—
Juega contra lo que se entrena aquí.
Un tablero, el panel del modelo y la lista de jugadas. En este primer hito el rival es "primera jugada legal"; a partir del módulo 2, el decoder entrenado en el curso.