Produktion
Klingt sauber. Sieht nach deiner Marke aus.
Hinter jedem Reel stehen eine geprüfte Sprachaufnahme, ein Bild für Bild gerendertes Video in deinen Farben und eine Tonmischung nach Plattform-Standard.
Sprachpipeline
Von der Aufnahme zur fertigen Tonspur.
Jeder Schritt hat feste Werte – damit jedes Reel gleich klingt.
- 1Abschnitte aufnehmen
Je etwa 2–3 Szenen eine Aufnahme mit der KI-Stimme deines Kontos.
- 2Zurückhören
Spracherkennung vergleicht Gehörtes mit dem Skript; Zeitmarken zeigen verschluckte und gedehnte Wörter.
- 3Neu aufnehmen
Bei Fehlern bis zu 4 Versuche je Abschnitt; die beste Aufnahme früherer Läufe wird zuerst geprüft.
- 4Pausen kürzen
Stille unter −38 dB ab 0,15 s wird auf höchstens 0,26 s gekürzt, mit weichen Übergängen.
- 5Tempo
× 1,10 per WSOLA – Sprache wird schneller, ohne höher oder metallisch zu klingen.
- 6Mischen
Musik und Effekte werden unter der Stimme abgesenkt, sanft begrenzt und auf −14 LUFS normalisiert.
Sprachprüfung
Was als Fehler zählt – und was nicht.
Die Prüfung ist streng bei dem, was Zuschauer hören, und tolerant bei dem, was nur Schreibweise ist.
- Fehler: Ähnlichkeit zum Skript unter 0,85
- Fehler: mehrere Wörter hintereinander ohne Dauer (verschluckt)
- Fehler: Wort länger als 0,7 s + 0,12 s je Buchstabe (gedehnt)
- Kein Fehler: Zahlen, die als Wort gesprochen werden
- Kein Fehler: Zusammenschreibung wie „Gratis-Stück“ ↔ „Gratisstück“
- Eigene Aussprache-Liste je Drehbuch für Marken- und Fachwörter
- Abschnitt 1 · Versuch 1Ähnlichkeit 0,97 · keine Fehlersauber
- Abschnitt 2 · Versuch 1verschluckt: „mit dem Angebot“neu
- Abschnitt 2 · Versuch 2Ähnlichkeit 0,96 · keine Fehlersauber
- Abschnitt 3 · Versuch 1gedehnt: „wirklich“ 1,61 sneu
- Abschnitt 3 · Versuch 2Ähnlichkeit 0,98 · keine Fehlersauber
Ton
−14 LUFS, Musik unter der Stimme, Effekte auf dem Wort.
Die Mischung entsteht aus Stimme, Musik und Soundeffekten. Wo gesprochen wird, gehen Musik und Effekte automatisch zurück. Zum Schluss wird auf die übliche Lautheit für Kurzvideos normalisiert.
- Lautheit −14 LUFS integriert, Spitze −1,5 dBTP, LRA 11
- AAC 192 kbit/s, 48 kHz, Stereo
- Effekt-Bibliothek mit 24 Arten (Whoosh, Klick, Pop, Riser, Stempel …)
- Zu kurze Musik wird mit Überblendung geschleift, zu lange am Ende ausgeblendet
Musikbibliothek
30 Stücke in 7 Stimmungen.
Die KI wählt im Drehbuch eine Stimmung, der Autopilot das passende Stück – lang genug zuerst und je Titel gestreut, damit nicht jedes Reel gleich klingt. Nur wenn keine Stimmung passt, wird im Projekt ein neues Stück erzeugt und aufgenommen.
Pulsierend, tickend, löst sich warm auf.
Modern, ruhig, vertrauenswürdig.
Hell und ruhig, wie eine Keynote.
Späte Stunde, Lo-Fi.
Klavier, verträumt, Vorfreude.
Upbeat, verspielt, Klatschen.
Arpeggios, technisch, neugierig.
Render
Technische Eckdaten
Reel
- Auflösung
- 1080 × 1920 (9:16)
- Bildrate
- 30 Bilder/s
- Bewegungsunschärfe
- mehrere Unterbilder je Bild gemittelt
- Codec
- H.264 High, yuv420p
- Länge
- Ziel 40–55 s
- Cover
- JPEG
Animierter Post
- Auflösung
- 1080 × 1350 (4:5)
- Ausgabe
- MP4 + Cover
Carousel
- Auflösung
- 1080 × 1350 (4:5)
- Folien
- 6–9 (Skript), 3–10 erlaubt
- Ausgabe je Folie
- JPEG und MP4
- Haltezeit
- 2,2 s nach dem Aufbau
Ton
- Lautheit
- −14 LUFS, −1,5 dBTP
- Format
- AAC 192 kbit/s, 48 kHz
- Sprechtempo
- × 1,10 (WSOLA)
- Max. Pause
- 0,26 s
Markenlook
Deine Farben, deine Schriften – automatisch erkannt.
Aus deiner Website werden Hintergrund, Textfarbe, Akzent und Schriften erkannt. Sie überschreiben die Grundfarben in Reels und Carousels; Schriften werden passend geladen. Hell oder dunkel ergibt sich aus deiner Marke.
- Akzentfarbe für Hervorhebungen und Übergänge
- Untertitel Wort für Wort, Schlüsselwörter markiert
- Logo dezent oder ohne Marke – je Konto festgelegt
- Kopfdaten (Format, Stil, Stimme) legt das Konto fest, nicht die KI
Carousels
Value-Carousels, die man speichert – animiert.
Die KI gestaltet jede Folie als eigene Seite in deinen Markenfarben. Eine automatische Prüfung misst Überlauf, Schriftgröße und Absenderzeile; danach sieht sich die KI die Standbilder an und bessert einmal nach. Folien, die dann noch nicht taugen, fallen auf eine feste Vorlage zurück.
- Überschrift baut sich Wort für Wort auf, Karten schweben ein, Zahlen zählen hoch
- Keine Schrift unter 24 px
- Absenderzeile mit Konto und „n / N →“ auf jeder Folie
- Ergebnis je Folie: JPEG und MP4
Bildsprache
Ein Gedanke pro Bild. Alles entsteht auf seinem Wort.
Die Reels folgen festen Regeln aus der Analyse gut laufender Kurzvideos.
Jedes Element erscheint auf dem Wort, zu dem es gehört.
Bildschirmzeile getrennt vom Sprechtext, höchstens 5 Wörter.
Verwandlung, Licht, Wischen, Schnitt, Kippen – ohne leeres Bild dazwischen.
Kein Bild kürzer als etwa 1,5 s, keins über mehr als 3 Sätze.
Figur oder konkrete Situation, Wendepunkte bei etwa ⅓ und ⅔.
Hervorhebungen in deiner Markenfarbe.
Hör dir an, wie dein Account klingen könnte.
Wir richten Stimme, Musikstimmung und Markenfarben mit dir ein.