Antes de generar
Checklist profesional
Voz
- —¿La voz encaja con la emoción buscada?
- —¿Tiene un registro natural para el idioma?
- —¿Es IVC o diseñada, para aprovechar mejor v3?
- —¿Se evita depender de una PVC en esta etapa?
Texto
- —¿Suena como una persona hablando?
- —¿Los números están escritos de forma clara?
- —¿Las frases son demasiado largas?
- —¿La puntuación refleja la respiración natural?
- —¿Hay emojis que deberían eliminarse?
Tags
- —¿Existe una emoción principal?
- —¿Hay máximo 1–3 tags relevantes?
- —¿Los tags están cerca del segmento que modifican?
- —¿Hay contradicciones entre tags?
Generación
- —¿Stability está en un nivel razonable (Natural como base)?
- —¿Se generaron varias muestras cuando la variabilidad importa?
- —¿Se evalúa la interpretación, no solo la pronunciación?
Troubleshooting
El tag parece ignorarse
- · ¿La voz es compatible con esa actuación?
- · ¿El texto contradice al tag?
- · ¿Hay demasiados tags?
- · ¿La estabilidad es demasiado alta?
- · ¿El tag está colocado cerca de la frase que debe modificar?
Suena sobreactuado
- · Reduce de [crying] [sad] [sighs] a [sighs] [sad], y después a solo [softly].
- · Principio: primero emoción, después intensidad — nunca al revés.
Suena robótico
- · Revisa el texto antes que los parámetros.
- · Añade puntuación de respiración natural y saltos de línea que separen beats.
- · Ejemplo: "Hola Miguel. Te extraño." → "[sighs] Hola, Miguel...\n\nTe extraño mucho."
Resultados demasiado distintos entre generaciones
- · v3 es no determinista: los sliders son rangos de variabilidad, no garantías.
- · Prioriza voz consistente + Natural stability + pocos tags + texto bien estructurado.
Fórmula maestra
Voz adecuada + Contexto humano + 1 emoción + 1 reacción física + 0–1 dirección de entrega + Puntuación natural = Interpretación convincente