Socio oficial de BytePlusCreado sobre BytePlus, la plataforma oficial de IA de ByteDance

Guía · Audio

Cómo escribir prompts de audio con marcas de tiempo

Escribe prompts de Audio Generation con marcas como [2s:5s]: una línea de escena, una marca por frase, dos voces y qué hace la etiqueta @Audio 1 en KreatorFlow.

  • Sintaxis [inicio s:fin s]
  • 24 idiomas
  • Hasta 3000 caracteres

Respuesta corta

En Audio Generation, describe la voz y la escena en la primera línea y pon cada frase en su propia línea con una marca de tiempo como [2s:5s] (segundo de inicio : segundo de fin). El comando / la inserta por ti. Los prompts admiten 3000 caracteres en 24 idiomas y cuestan 1 crédito por cada 10 segundos de audio empezados (mínimo 2 créditos).

Actualizado:

Paso a paso

  1. 1

    Describe la escena

    Primera línea: quién habla, en qué tono y dónde. Por ejemplo: "Un presentador de noticias, claro y sereno, abre el boletín".

  2. 2

    Una frase por línea, con su marca

    Escribe cada frase en una línea nueva que empiece con [inicio s:fin s], por ejemplo [0s:4s]. Usa el comando / y elige la marca de tiempo para insertarla.

  3. 3

    Ajusta la duración a la frase

    Deja a cada marca tiempo suficiente para su texto: unas dos o tres palabras por segundo. Mantén las marcas en orden y sin solaparse.

  4. 4

    Añade una segunda voz si hace falta

    Empieza la frase con "Speaker A:" o "Speaker B:" después de la marca para un diálogo.

  5. 5

    Elige idioma y genera

    Elige uno de los 24 idiomas en el selector, ajusta tono, velocidad y volumen si quieres, y genera. Si el ritmo no cuadra, ajusta las marcas y vuelve a generar.

Prompts de ejemplo

Cópialos en Audio Generation y cambia el texto por el tuyo.

  • Lanzamiento de producto

    Una voz de anuncio segura presenta un producto nuevo. [0s:3s] Llega el nuevo cargador. [3s:7s] Un solo cable para el móvil, el reloj y los auriculares. [7s:10s] Disponible desde hoy.

  • Diálogo a dos voces

    Dos amigos planean un viaje, tono relajado y natural. [0s:4s] Speaker A: ¿Y si este fin de semana vamos a la costa? [4s:8s] Speaker B: Solo si salimos temprano y paramos a desayunar. [8s:11s] Speaker A: Trato hecho.

  • Respiración guiada

    Una guía tranquila dirige una respiración con pausas largas. [0s:6s] Inspira despacio por la nariz. [6s:12s] Y suelta el aire, dejando caer los hombros.

La sintaxis [2s:5s]

Una marca indica el segundo en que empieza y termina una frase: [2s:5s] significa del segundo 2 al 5. El estudio usa el mismo formato en sus plantillas de tiempo.

Las marcas son indicaciones de ritmo que el modelo lee, no cortes exactos: el resultado puede desviarse un poco. Para un ritmo fiable, deja margen en cada marca y genera dos versiones.

Qué hace @Audio 1

El comando / también inserta @Audio 1, una etiqueta que las plantillas de referencia del estudio usan para "la voz del clip de referencia 1". Audio Generation en KreatorFlow envía solo el texto del prompt y no tiene subida de clips, así que describe también con palabras la voz que quieres, por ejemplo "un narrador cálido y pausado".

En el estudio de video es distinto: los clips de audio que adjuntas se numeran Audio 1, Audio 2 y así hasta 3, y el prompt puede referirse a ellos.

Preguntas frecuentes

¿Las marcas de tiempo son exactas?

No. Son indicaciones de ritmo que el modelo sigue lo mejor que puede. Deja margen y genera dos versiones si el ritmo es importante.

¿Puedo usar un clip de referencia de voz?

Audio Generation envía solo texto y no admite subir un clip. Describe la voz con palabras. En el estudio de video sí puedes adjuntar referencias de audio.

¿Cuánto cuesta?

1 crédito por cada 10 segundos de audio empezados (mínimo 2 créditos). El estudio muestra una estimación a partir de tu prompt antes de generar, y el cobro final sigue la duración del audio generado.

Pruébalo en el estudio

Las cuentas nuevas reciben 75 créditos de inicio para imágenes y video. Las cuentas gratis pueden crear video con Seedance 2 Fast y Seedance 2.0 Mini a 480p, con cola y límites de uso. Un plan añade todos los modelos de video, 720p o superior, y sin cola. El coste se muestra antes de cada generación.

Más guías