○ unseen · kind paper · level 2 · 0h

VALL-E (Harbin Institute of Technology + Nankai + USTC): TTS como tarea de modelado de lenguaje condicional sobre códigos discretos de un codec neural de audio, en vez de regresión de señal continua. Con 50k horas de habla inglesa en pre-training emerge aprendizaje in-context: sintetiza voz personalizada de alta calidad con solo 3 segundos de grabación de un hablante no visto (zero-shot).

Institución: Harbin Institute of Technology, Nankai University, USTC · Citas: 112 · 2025

Enlaces

Fuentes