◐ learning · kind experiment · level 1 · 0h

Una cadena de producción donde un LLM genera guiones estructurados, se segmentan por bloques cortos (<180 chars), y Orpheus-TTS sintetiza audio WAV que luego pasa por FFmpeg para normalización y mezcla. Permite regenerar segmentos individuales sin re-renderizar la hora completa.

Mecanismo: El LLM recibe RSS o noticias, genera un guion JSON con metadatos (intro, bloques de mundo/nacional/tech). Un script divide el texto en chunks ≤180 caracteres aplicando “directions” para tono ([authoritatively], [cheerful]). Cada chunk se envía a la API local de Orpheus-TTS. FFmpeg concatena los WAVs y aplica loudnorm, EQ y música de fondo.

Límite: Dependencia del modelo TTS (Orpheus) en calidad prosódica para español si no se usa el modelo inglés por defecto. Latencia inicial al levantar la API local. Requiere GPU o CPU potente para inferencia streaming rápida.

Ejercicio: Probar radioctl generate today con un script de prueba que produzca 60 minutos de audio simulado usando RSS locales y verificar duración final vs. tiempo estimado.

Enlaces

Fuentes