Tiny LLM Studio ES

Fecha: 2026-09-06 02:37 CST

Decision

Crear y mantener ~/.openclaw/workspace/tiny-llm-studio-es/ como fork/adaptacion en espanol de Tiny LLM Studio.

Contexto

  • El proyecto original tiny-llm-studio/ nacio como workbench para entrenar desde cero un LLM chino de 0.1B parametros.
  • El fork ES conserva la arquitectura y backend Python porque el Transformer, el loop de entrenamiento y el sistema de checkpoints son agnosticos al idioma.
  • Lo que cambia para espanol es el corpus, la tokenizacion, los benchmarks simulados, prompts de inferencia, labels del sandbox y nombres de exportacion.

Cambios aplicados

  • web/src/lib/core.ts: contenido del sandbox adaptado a espanol: datasets, frecuencias de caracteres, tokenizador demo, fases, prompts, respuestas, benchmarks y model card.
  • web/src/components/*: pantallas principales traducidas a espanol, incluyendo Corpus, Tokenizador, Arquitectura, Entrenamiento, Evaluacion, Inferencia y Exportacion.
  • web/src/lib/i18n.ts: idioma default cambiado a es; se conserva toggle ES/ZH para comparar.
  • tls.yaml: rutas de corpus cambiadas a data/es/raw y data/es/tokenized; experimento default es-run-001.
  • tls/tokenize.py: character_coverage=0.9999, mejor default para espanol.
  • pyproject.toml: paquete tiny-llm-studio-es y script CLI tls-es para evitar choque con la version original.

Como correr

Sandbox UI:

cd ~/.openclaw/workspace/tiny-llm-studio-es/web
npm install
npm run build
npx serve dist -p 3002

Backend real:

cd ~/.openclaw/workspace/tiny-llm-studio-es
pip install -e .
tls-es tokenize
tls-es pretrain
tls-es ui

Estado

  • Build frontend verificado con npm run build.
  • Servidor estatico levantado en http://localhost:3002.
  • Queda pendiente conectar corpus real en espanol y ejecutar una prueba pequena de tls-es tokenize.