Eleven v3 Dirección interpretativa

Manual técnico · eleven_v3

No le pidas a la voz que suene emocional. Dale una escena que interpretar.

Este manual explica cómo dirigir la interpretación de eleven_v3 combinando contexto semántico, audio tags y puntuación — en vez de pedirle al modelo un tono genérico.

01 · Arquitectura

v3 frente a v2/v2.5

En modelos anteriores el flujo era prácticamente texto → interpretación lingüística → síntesis. Con v3 se añade una capa de dirección: el resultado es la interacción entre voz base, texto, contexto semántico, audio tags, puntuación y la configuración de estabilidad.

Texto ↓ Contexto semántico + Dirección interpretativa ↓ Audio tags + Puntuación / estructura ↓ Interpretación vocal ↓ Síntesis

Elige v3 cuando priorices

Emoción, naturalidad interpretativa, personajes, storytelling, mensajes íntimos, narración dramática, diálogos y reacciones humanas.

Elige v2.5 cuando priorices

Baja latencia, conversaciones en tiempo real, comportamiento predecible y generación rápida y repetitiva.

v3 = interpretación. v2.5 = previsibilidad y velocidad.

02 · Regla central

El trinomio emocional

La fórmula de referencia para combinar tags sin sobrecargar la generación:

Estado

Qué siente — [sad]

+

Comportamiento

Qué hace el cuerpo — [sighs]

+

Intensidad

Cómo lo dice — [softly]

[sighs] [sad] Te extraño mucho... [softly] Contéstame, por fa.

Recomendación de producción: 1 emoción principal, 1 comportamiento, 0–1 modificación de entrega. Apilar más tags no añade emoción; suele añadir ruido e instrucciones contradictorias.

03 · Control fundamental

Estabilidad (Stability)

Creative Máxima expresividad. Más variabilidad entre generaciones.
Natural Equilibrio entre expresividad y estabilidad. Buen punto de partida.
Robust Mayor consistencia, pero responde menos a la dirección de los tags.

Natural es el mejor punto de partida. Nota: la Velocidad (Speed) no está disponible para v3 — el ritmo se controla con puntuación, longitud de frase, estructura, tags, voz y estabilidad, en ese orden.

04 · El factor subestimado

La voz base

El mismo prompt produce resultados muy distintos según la voz. [whispers] Te quiero. puede sonar magnífico en una voz íntima y extraño en una voz de noticias o deportes. Los Professional Voice Clones aún no están del todo optimizados para v3: conviene priorizar voces diseñadas o Instant Voice Clones para aprovechar mejor la expresividad del modelo.

Ver diccionario de tags → Reglas de puntuación →