Socio oficial de BytePlusCreado sobre BytePlus, la plataforma oficial de IA de ByteDance
Guía · Audio
Cómo escribir prompts de audio con marcas de tiempo
Escribe prompts de Audio Generation con marcas como [2s:5s]: una línea de escena, una marca por frase, dos voces y qué hace la etiqueta @Audio 1 en KreatorFlow.
- Sintaxis [inicio s:fin s]
- 24 idiomas
- Hasta 3000 caracteres
Respuesta corta
En Audio Generation, describe la voz y la escena en la primera línea y pon cada frase en su propia línea con una marca de tiempo como [2s:5s] (segundo de inicio : segundo de fin). El comando / la inserta por ti. Los prompts admiten 3000 caracteres en 24 idiomas y cuestan 1 crédito por cada 10 segundos de audio empezados (mínimo 2 créditos).
Actualizado:
Paso a paso
- 1
Describe la escena
Primera línea: quién habla, en qué tono y dónde. Por ejemplo: "Un presentador de noticias, claro y sereno, abre el boletín".
- 2
Una frase por línea, con su marca
Escribe cada frase en una línea nueva que empiece con [inicio s:fin s], por ejemplo [0s:4s]. Usa el comando / y elige la marca de tiempo para insertarla.
- 3
Ajusta la duración a la frase
Deja a cada marca tiempo suficiente para su texto: unas dos o tres palabras por segundo. Mantén las marcas en orden y sin solaparse.
- 4
Añade una segunda voz si hace falta
Empieza la frase con "Speaker A:" o "Speaker B:" después de la marca para un diálogo.
- 5
Elige idioma y genera
Elige uno de los 24 idiomas en el selector, ajusta tono, velocidad y volumen si quieres, y genera. Si el ritmo no cuadra, ajusta las marcas y vuelve a generar.
Prompts de ejemplo
Cópialos en Audio Generation y cambia el texto por el tuyo.
Lanzamiento de producto
Una voz de anuncio segura presenta un producto nuevo. [0s:3s] Llega el nuevo cargador. [3s:7s] Un solo cable para el móvil, el reloj y los auriculares. [7s:10s] Disponible desde hoy.
Diálogo a dos voces
Dos amigos planean un viaje, tono relajado y natural. [0s:4s] Speaker A: ¿Y si este fin de semana vamos a la costa? [4s:8s] Speaker B: Solo si salimos temprano y paramos a desayunar. [8s:11s] Speaker A: Trato hecho.
Respiración guiada
Una guía tranquila dirige una respiración con pausas largas. [0s:6s] Inspira despacio por la nariz. [6s:12s] Y suelta el aire, dejando caer los hombros.
La sintaxis [2s:5s]
Una marca indica el segundo en que empieza y termina una frase: [2s:5s] significa del segundo 2 al 5. El estudio usa el mismo formato en sus plantillas de tiempo.
Las marcas son indicaciones de ritmo que el modelo lee, no cortes exactos: el resultado puede desviarse un poco. Para un ritmo fiable, deja margen en cada marca y genera dos versiones.
Qué hace @Audio 1
El comando / también inserta @Audio 1, una etiqueta que las plantillas de referencia del estudio usan para "la voz del clip de referencia 1". Audio Generation en KreatorFlow envía solo el texto del prompt y no tiene subida de clips, así que describe también con palabras la voz que quieres, por ejemplo "un narrador cálido y pausado".
En el estudio de video es distinto: los clips de audio que adjuntas se numeran Audio 1, Audio 2 y así hasta 3, y el prompt puede referirse a ellos.
Preguntas frecuentes
¿Las marcas de tiempo son exactas?
No. Son indicaciones de ritmo que el modelo sigue lo mejor que puede. Deja margen y genera dos versiones si el ritmo es importante.
¿Puedo usar un clip de referencia de voz?
Audio Generation envía solo texto y no admite subir un clip. Describe la voz con palabras. En el estudio de video sí puedes adjuntar referencias de audio.
¿Cuánto cuesta?
1 crédito por cada 10 segundos de audio empezados (mínimo 2 créditos). El estudio muestra una estimación a partir de tu prompt antes de generar, y el cobro final sigue la duración del audio generado.
Pruébalo en el estudio
Las cuentas nuevas reciben 75 créditos de inicio para imágenes y video. Las cuentas gratis pueden crear video con Seedance 2 Fast y Seedance 2.0 Mini a 480p, con cola y límites de uso. Un plan añade todos los modelos de video, 720p o superior, y sin cola. El coste se muestra antes de cada generación.