Google Cloud TTS estilo Valentino / TikTok para radio — 2026-09-06

Proyecto gcloud: project-323ffb8d-90a3-4bc3-971 (cuenta [ID-EMAIL]) API: texttospeech.googleapis.com/v1 vía REST + gcloud auth print-access-token. El CLI gcloud ml tts ya no existe en SDK 579 — usar REST.

Voces que más se acercan a Valentino (masculino joven, enérgico)

Para radio en México usar es-US, no es-ES (España suena con ceceo):

  • es-US-Studio-B MALE — diseñada para broadcast/noticias. Mejor para aire.
  • es-US-Neural2-B MALE — permite pitch/speed, mejor para clonar estilo TikTok.
  • es-US-Chirp3-HD-Algenib / Achird / Algieba MALE — más naturales/virales, pero NO aceptan speakingRate/pitch.

Femeninas virales TikTok equivalentes:

  • es-US-Neural2-A FEMALE, es-US-Chirp3-HD-Aoede / Zephyr

Listar voces

TOKEN=$(gcloud auth print-access-token)
curl -s -H "Authorization: Bearer $TOKEN" \
  -H "x-goog-user-project: project-323ffb8d-90a3-4bc3-971" \
  "https://texttospeech.googleapis.com/v1/voices?languageCode=es-US" | python3 -m json.tool | head -80

Sintetizar (Neural2 / Studio — con control estilo TikTok)

TOKEN=$(gcloud auth print-access-token)
curl -s -H "Authorization: Bearer $TOKEN" \
  -H "x-goog-user-project: project-323ffb8d-90a3-4bc3-971" \
  -H "Content-Type: application/json" -X POST \
  "https://texttospeech.googleapis.com/v1/text:synthesize" -d '{
    "input": {"text": "Estás escuchando Radio Nef, la voz que te acompaña todo el día."},
    "voice": {"languageCode": "es-US", "name": "es-US-Neural2-B", "ssmlGender": "MALE"},
    "audioConfig": {"audioEncoding": "MP3", "speakingRate": 1.1, "pitch": 2.0}
  }' | python3 -c "import json,sys,base64; d=json.load(sys.stdin); open('demo.mp3','wb').write(base64.b64decode(d['audioContent']))"

Receta estilo Valentino: speakingRate 1.05–1.15, pitch +1 a +3. Para cortinilla más grave de radio: pitch -2, rate 0.95.

Sintetizar (Chirp3-HD — más natural, sin pitch/rate)

# voice: es-US-Chirp3-HD-Algenib, audioConfig solo audioEncoding MP3

Valentino de CapCut/TikTok no tiene licencia clara para broadcast. Usar Google TTS con voz propia inspirada evita ese problema. No clonar la voz de un tiktoker real sin permiso escrito.