Manual técnico · eleven_v3
No le pidas a la voz que suene emocional. Dale una escena que interpretar.
Este manual explica cómo dirigir la interpretación de eleven_v3 combinando contexto semántico, audio tags y puntuación — en vez de pedirle al modelo un tono genérico.
01 · Arquitectura
v3 frente a v2/v2.5
En modelos anteriores el flujo era prácticamente texto → interpretación lingüística → síntesis. Con v3 se añade una capa de dirección: el resultado es la interacción entre voz base, texto, contexto semántico, audio tags, puntuación y la configuración de estabilidad.
Elige v3 cuando priorices
Emoción, naturalidad interpretativa, personajes, storytelling, mensajes íntimos, narración dramática, diálogos y reacciones humanas.
Elige v2.5 cuando priorices
Baja latencia, conversaciones en tiempo real, comportamiento predecible y generación rápida y repetitiva.
v3 = interpretación. v2.5 = previsibilidad y velocidad.
02 · Regla central
El trinomio emocional
La fórmula de referencia para combinar tags sin sobrecargar la generación:
Estado
Qué siente — [sad]
Comportamiento
Qué hace el cuerpo — [sighs]
Intensidad
Cómo lo dice — [softly]
Recomendación de producción: 1 emoción principal, 1 comportamiento, 0–1 modificación de entrega. Apilar más tags no añade emoción; suele añadir ruido e instrucciones contradictorias.
03 · Control fundamental
Estabilidad (Stability)
Natural es el mejor punto de partida. Nota: la Velocidad (Speed) no está disponible para v3 — el ritmo se controla con puntuación, longitud de frase, estructura, tags, voz y estabilidad, en ese orden.
04 · El factor subestimado
La voz base
El mismo prompt produce resultados muy distintos según la voz. [whispers] Te quiero.
puede sonar magnífico en una voz íntima y extraño en una voz de noticias o deportes.
Los Professional Voice Clones aún no están del todo optimizados para v3: conviene priorizar
voces diseñadas o Instant Voice Clones para aprovechar mejor la expresividad del modelo.