elevatemdev Gespräch anfragen
Social-AutopilotSocial Media

Produktion

Klingt sauber. Sieht nach deiner Marke aus.

Hinter jedem Reel stehen eine geprüfte Sprachaufnahme, ein Bild für Bild gerendertes Video in deinen Farben und eine Tonmischung nach Plattform-Standard.

TonmischungBeispiel
Lautheit−14 LUFSintegriert, Spitze −1,5 dBTP
Sprechtempo× 1,10WSOLA, ohne Tonhöhenänderung
Längste Pause0,26 sechte Stille gekürzt
Musikwarm-2Stimmung „warm“ aus der Bibliothek
Effekte11Whoosh, Klick, Pop …
Länge48 sZiel 40–55 s

Sprachpipeline

Von der Aufnahme zur fertigen Tonspur.

Jeder Schritt hat feste Werte – damit jedes Reel gleich klingt.

  1. 1
    Abschnitte aufnehmen

    Je etwa 2–3 Szenen eine Aufnahme mit der KI-Stimme deines Kontos.

  2. 2
    Zurückhören

    Spracherkennung vergleicht Gehörtes mit dem Skript; Zeitmarken zeigen verschluckte und gedehnte Wörter.

  3. 3
    Neu aufnehmen

    Bei Fehlern bis zu 4 Versuche je Abschnitt; die beste Aufnahme früherer Läufe wird zuerst geprüft.

  4. 4
    Pausen kürzen

    Stille unter −38 dB ab 0,15 s wird auf höchstens 0,26 s gekürzt, mit weichen Übergängen.

  5. 5
    Tempo

    × 1,10 per WSOLA – Sprache wird schneller, ohne höher oder metallisch zu klingen.

  6. 6
    Mischen

    Musik und Effekte werden unter der Stimme abgesenkt, sanft begrenzt und auf −14 LUFS normalisiert.

Sprachprüfung

Was als Fehler zählt – und was nicht.

Die Prüfung ist streng bei dem, was Zuschauer hören, und tolerant bei dem, was nur Schreibweise ist.

  • Fehler: Ähnlichkeit zum Skript unter 0,85
  • Fehler: mehrere Wörter hintereinander ohne Dauer (verschluckt)
  • Fehler: Wort länger als 0,7 s + 0,12 s je Buchstabe (gedehnt)
  • Kein Fehler: Zahlen, die als Wort gesprochen werden
  • Kein Fehler: Zusammenschreibung wie „Gratis-Stück“ ↔ „Gratisstück“
  • Eigene Aussprache-Liste je Drehbuch für Marken- und Fachwörter
Stimmprüfung je AbschnittBeispiel
  • Abschnitt 1 · Versuch 1Ähnlichkeit 0,97 · keine Fehler
    sauber
  • Abschnitt 2 · Versuch 1verschluckt: „mit dem Angebot“
    neu
  • Abschnitt 2 · Versuch 2Ähnlichkeit 0,96 · keine Fehler
    sauber
  • Abschnitt 3 · Versuch 1gedehnt: „wirklich“ 1,61 s
    neu
  • Abschnitt 3 · Versuch 2Ähnlichkeit 0,98 · keine Fehler
    sauber

Musikbibliothek

30 Stücke in 7 Stimmungen.

Die KI wählt im Drehbuch eine Stimmung, der Autopilot das passende Stück – lang genug zuerst und je Titel gestreut, damit nicht jedes Reel gleich klingt. Nur wenn keine Stimmung passt, wird im Projekt ein neues Stück erzeugt und aufgenommen.

spannung

Pulsierend, tickend, löst sich warm auf.

warm

Modern, ruhig, vertrauenswürdig.

luftig

Hell und ruhig, wie eine Keynote.

nacht

Späte Stunde, Lo-Fi.

hoffnung

Klavier, verträumt, Vorfreude.

energie

Upbeat, verspielt, Klatschen.

clever

Arpeggios, technisch, neugierig.

Render

Technische Eckdaten

Reel

Auflösung
1080 × 1920 (9:16)
Bildrate
30 Bilder/s
Bewegungsunschärfe
mehrere Unterbilder je Bild gemittelt
Codec
H.264 High, yuv420p
Länge
Ziel 40–55 s
Cover
JPEG

Animierter Post

Auflösung
1080 × 1350 (4:5)
Ausgabe
MP4 + Cover

Carousel

Auflösung
1080 × 1350 (4:5)
Folien
6–9 (Skript), 3–10 erlaubt
Ausgabe je Folie
JPEG und MP4
Haltezeit
2,2 s nach dem Aufbau

Ton

Lautheit
−14 LUFS, −1,5 dBTP
Format
AAC 192 kbit/s, 48 kHz
Sprechtempo
× 1,10 (WSOLA)
Max. Pause
0,26 s

Markenlook

Deine Farben, deine Schriften – automatisch erkannt.

Aus deiner Website werden Hintergrund, Textfarbe, Akzent und Schriften erkannt. Sie überschreiben die Grundfarben in Reels und Carousels; Schriften werden passend geladen. Hell oder dunkel ergibt sich aus deiner Marke.

  • Akzentfarbe für Hervorhebungen und Übergänge
  • Untertitel Wort für Wort, Schlüsselwörter markiert
  • Logo dezent oder ohne Marke – je Konto festgelegt
  • Kopfdaten (Format, Stil, Stimme) legt das Konto fest, nicht die KI
Warum alle diese Lampe kaufen
Dimmbar, kabellos, hält einen Abend lang. Und sieht dabei gut aus.

Bildsprache

Ein Gedanke pro Bild. Alles entsteht auf seinem Wort.

Die Reels folgen festen Regeln aus der Analyse gut laufender Kurzvideos.

Wort-Sync

Jedes Element erscheint auf dem Wort, zu dem es gehört.

Kurze Zeilen

Bildschirmzeile getrennt vom Sprechtext, höchstens 5 Wörter.

Übergänge

Verwandlung, Licht, Wischen, Schnitt, Kippen – ohne leeres Bild dazwischen.

Tempo

Kein Bild kürzer als etwa 1,5 s, keins über mehr als 3 Sätze.

Geschichte statt Vortrag

Figur oder konkrete Situation, Wendepunkte bei etwa ⅓ und ⅔.

Eine Akzentfarbe

Hervorhebungen in deiner Markenfarbe.

Hör dir an, wie dein Account klingen könnte.

Wir richten Stimme, Musikstimmung und Markenfarben mit dir ein.