Offizieller BytePlus-PartnerBasiert auf BytePlus, der offiziellen KI-Plattform von ByteDance
Anleitung · Audio
So schreibst du Audio-Prompts mit Zeitmarken
Prompts für Audio Generation mit Zeitmarken wie [2s:5s]: eine Szenenzeile, eine Marke pro Satz, zwei Sprecher und was @Audio 1 in KreatorFlow tut.
- Syntax [Start s:Ende s]
- 24 Sprachen
- Bis zu 3.000 Zeichen
Kurze Antwort
Beschreib in Audio Generation in der ersten Zeile Stimme und Szene und setz jeden Satz in eine eigene Zeile mit einer Zeitmarke wie [2s:5s] (Startsekunde : Endsekunde). Der /-Befehl fügt sie ein. Prompts fassen 3.000 Zeichen in 24 Sprachen und kosten 1 Credit pro angefangene 10 Sekunden Audio (mindestens 2 Credits).
Aktualisiert:
Schritt für Schritt
- 1
Die Szene beschreiben
Erste Zeile: wer spricht, in welchem Ton und wo. Zum Beispiel: "Ein klarer, ruhiger Nachrichtensprecher eröffnet die Sendung".
- 2
Ein Satz pro Zeile, mit Marke
Schreib jeden Satz in eine neue Zeile, die mit [Start s:Ende s] beginnt, etwa [0s:4s]. Mit dem /-Befehl fügst du die Zeitmarke ein.
- 3
Die Dauer an den Satz anpassen
Gib jeder Marke genug Zeit für ihren Text: etwa zwei bis drei Wörter pro Sekunde. Halte die Marken in Reihenfolge und ohne Überschneidung.
- 4
Bei Bedarf eine zweite Stimme
Beginn den Satz nach der Marke mit "Speaker A:" oder "Speaker B:" für einen Dialog.
- 5
Sprache wählen und erzeugen
Wähle eine der 24 Sprachen im Menü, stell bei Bedarf Ton, Tempo und Lautstärke ein und erzeuge. Passt das Timing nicht, verschieb die Marken und erzeuge neu.
Beispiel-Prompts
Kopier sie in Audio Generation und ersetz den Text durch deinen.
Produktstart
Eine selbstbewusste Werbestimme stellt ein neues Produkt vor. [0s:3s] Das neue Ladegerät ist da. [3s:7s] Ein Kabel für Handy, Uhr und Kopfhörer. [7s:10s] Ab heute erhältlich.
Dialog mit zwei Stimmen
Zwei Freunde planen einen Ausflug, locker und natürlich. [0s:4s] Speaker A: Fahren wir am Wochenende an die Küste? [4s:8s] Speaker B: Nur wenn wir früh losfahren und unterwegs frühstücken. [8s:11s] Speaker A: Abgemacht.
Geführte Atmung
Eine ruhige Stimme leitet eine Atemübung mit langen Pausen an. [0s:6s] Atme langsam durch die Nase ein. [6s:12s] Und lass die Luft los, die Schultern sinken.
Die Syntax [2s:5s]
Eine Marke gibt an, in welcher Sekunde ein Satz beginnt und endet: [2s:5s] heißt von Sekunde 2 bis 5. Das Studio nutzt dasselbe Format in seinen Timing-Vorlagen.
Die Marken sind Timing-Hinweise, die das Modell liest, keine exakten Schnitte: Das Ergebnis kann leicht abweichen. Für verlässliches Timing lass jeder Marke etwas Luft und erzeuge zwei Versionen.
Was @Audio 1 bewirkt
Der /-Befehl fügt auch @Audio 1 ein, ein Tag, das die Referenz-Vorlagen des Studios für "die Stimme aus Referenzclip 1" nutzen. Audio Generation in KreatorFlow sendet nur den Text des Prompts und hat keinen Clip-Upload, beschreib die gewünschte Stimme also auch in Worten, etwa "ein warmer, ruhiger Erzähler".
Im Videostudio ist es anders: Angehängte Audioclips werden als Audio 1, Audio 2 und so weiter bis 3 nummeriert, und der Prompt kann sich auf sie beziehen.
Häufige Fragen
Sind die Zeitmarken exakt?
Nein. Es sind Timing-Hinweise, denen das Modell so gut wie möglich folgt. Lass Luft und erzeuge zwei Versionen, wenn es aufs Timing ankommt.
Kann ich einen Referenzclip für die Stimme nutzen?
Audio Generation sendet nur Text und nimmt keinen Clip-Upload an. Beschreib die Stimme in Worten. Im Videostudio kannst du Audioreferenzen anhängen.
Was kostet es?
1 Credit pro angefangene 10 Sekunden Audio (mindestens 2 Credits). Das Studio zeigt vor dem Generieren eine Schätzung anhand deines Prompts, abgerechnet wird nach der Länge des erzeugten Audios.
Probier es im Studio aus
Neue Konten erhalten 75 Start-Credits für Bilder und Videos. Kostenlose Konten erstellen Videos mit Seedance 2 Fast und Seedance 2.0 Mini in 480p, mit Warteschlange und begrenzter Anzahl. Ein Plan bringt alle Videomodelle, 720p oder höher, und keine Warteschlange. Die Kosten siehst du vor jeder Generierung.