Eleven v3 Dirección interpretativa

Antes de generar

Checklist profesional

Voz

  • ¿La voz encaja con la emoción buscada?
  • ¿Tiene un registro natural para el idioma?
  • ¿Es IVC o diseñada, para aprovechar mejor v3?
  • ¿Se evita depender de una PVC en esta etapa?

Texto

  • ¿Suena como una persona hablando?
  • ¿Los números están escritos de forma clara?
  • ¿Las frases son demasiado largas?
  • ¿La puntuación refleja la respiración natural?
  • ¿Hay emojis que deberían eliminarse?

Tags

  • ¿Existe una emoción principal?
  • ¿Hay máximo 1–3 tags relevantes?
  • ¿Los tags están cerca del segmento que modifican?
  • ¿Hay contradicciones entre tags?

Generación

  • ¿Stability está en un nivel razonable (Natural como base)?
  • ¿Se generaron varias muestras cuando la variabilidad importa?
  • ¿Se evalúa la interpretación, no solo la pronunciación?

Troubleshooting

El tag parece ignorarse

  • · ¿La voz es compatible con esa actuación?
  • · ¿El texto contradice al tag?
  • · ¿Hay demasiados tags?
  • · ¿La estabilidad es demasiado alta?
  • · ¿El tag está colocado cerca de la frase que debe modificar?

Suena sobreactuado

  • · Reduce de [crying] [sad] [sighs] a [sighs] [sad], y después a solo [softly].
  • · Principio: primero emoción, después intensidad — nunca al revés.

Suena robótico

  • · Revisa el texto antes que los parámetros.
  • · Añade puntuación de respiración natural y saltos de línea que separen beats.
  • · Ejemplo: "Hola Miguel. Te extraño." → "[sighs] Hola, Miguel...\n\nTe extraño mucho."

Resultados demasiado distintos entre generaciones

  • · v3 es no determinista: los sliders son rangos de variabilidad, no garantías.
  • · Prioriza voz consistente + Natural stability + pocos tags + texto bien estructurado.

Fórmula maestra

Voz adecuada + Contexto humano + 1 emoción + 1 reacción física + 0–1 dirección de entrega + Puntuación natural = Interpretación convincente