So erstellen Sie ein 60-Sekunden-KI-Erklärvideo, das nicht nach KI aussieht
Ein wiederholbarer Workflow für Erklärvideos mit echter Bewegung, echtem Voiceover und ohne Uncanny-Valley-Momente. Wird von Gründern genutzt, um Produkteinführungen an einem einzigen Nachmittag zu realisieren.
Die meisten KI-Erklärvideos sehen aus wie KI-Erklärvideos. Das Voiceover klingt leicht daneben, die Bilder passen nicht ganz zu den Worten und das Ganze hat diese Qualität von „Sonntags ohne Schnitt gemacht“. Das ist kein KI-Problem, das ist ein Prozessproblem.
Diese Anleitung gibt Ihnen den exakten 60-Sekunden-Workflow für Erklärvideos, den Gründer für Produkteinführungen verwenden und der für B2B SaaS, Kurse, Consumer Apps und physische Produkte gleichermaßen funktioniert.
Der Drei-Tool-Stack
Sie benötigen kein After Effects, Premiere oder herkömmliche Schnittkenntnisse.
Bevorzugen Sie einen Desktop-Editor mit einer echten Timeline? CapCut ist schnell für Social-Media-Schnitte, aber wenn Sie lieber in einem herkömmlichen Editor mit denselben KI-Funktionen (Auto-Cut, KI-Untertitel, Beat-Sync) und einer Einmal-Lizenz anstelle eines monatlichen Abonnements arbeiten möchten, tauschen Sie CapCut gegen Wondershare Filmora. Derselbe Fünf-Schritte-Workflow, dieselben Exporteinstellungen.
- Runway Gen-4.5 für kurze generative Motion-Clips (sich materialisierende Logos, fließende abstrakte Daten, rotierende Produkt-Silhouetten).
- ElevenLabs für das Voiceover, nur v3-Stimmen.
- CapCut für den Schnitt, Beat-Sync und das finale Polishing.
Schritt 1: Skript für 60 Sekunden schreiben (15 Minuten)
Ein 60-Sekunden-Erklärvideo sind genau 150-160 Wörter bei natürlicher Sprechgeschwindigkeit. Nicht 200. Nicht 250. Das Kürzen von 250 auf 160 ist der Punkt, an dem die meisten Gründer die Arbeit scheuen, und das ist es, was das Video ruiniert.
Struktur, die funktioniert:
Schreiben Sie es. Lesen Sie es laut vor. Stoppen Sie die Zeit. Streichen Sie jedes „wirklich“, „sehr“ und „erstaunlich“. Wenn Sie bei natürlicher Sprechgeschwindigkeit über 65 Sekunden liegen, kürzen Sie weiter.
- Sekunden 0-5: Das Problem. Ein Satz. Eindringlich. „Wenn Sie jemals einen Sonntag damit verbracht haben, dieselbe Tabelle neu zu erstellen, dann ist das hier für Sie.“
- Sekunden 5-25: Die Lösung. Drei Sätze. Konkret. Was es ist, für wen es ist, warum es anders ist.
- Sekunden 25-50: Ein konkretes Ergebnis. Eine Zahl, ein Kunden-Zitat, ein Vorher/Nachher. Das, was es real macht.
- Sekunden 50-60: Der CTA. Eine Aufforderung. „Probieren Sie es kostenlos unter [domain] aus.“ Wiederholen Sie die Domain zweimal, wenn möglich.
Schritt 2: Storyboard für die Bilder (10 Minuten)
Schreiben Sie für jeden Satz auf, was auf dem Bildschirm zu sehen ist. Überspringen Sie das nicht, die Versuchung ist groß, „die Bilder während des Schnitts zu finden“, und so landen Sie bei zufälligem Stock-Material, das zu nichts passt.
Format:
- „Wenn Sie jemals einen Sonntag damit verbracht haben, dieselbe Tabelle neu zu erstellen…“ → animierte Tabellenkalkulationszellen, die sich füllen und leeren, dunkle UI
- „Dann ist das hier für Sie.“ → Schnitt zum Produktlogo, 1 Sekunde halten
- „[Produkt] ist [Kategorie] für [Benutzer].“ → Bildschirmaufnahme der Produkt-UI, schneller Scroll
- … usw.
Schritt 3: Voiceover in ElevenLabs generieren (5 Minuten)
Öffnen Sie ElevenLabs, wählen Sie eine v3-Stimme. Die v3-Bibliothek von 2026 bietet Stimmen, die wie echte Menschen klingen, die echte Lesungen machen, mit Tempoänderungen, Atemgeräuschen und leichten Betonungsunterschieden. Vermeiden Sie für Erklärvideos die älteren multilingualen v2-Stimmen; sie klingen im Vergleich zu v3 flach.
Einstellungen für Erklärvideos:
Generieren Sie das vollständige Skript als eine Aufnahme. Wenn ein einzelner Satz falsch klingt, generieren Sie nur diesen Satz mit der v3-Satz-für-Satz-Regenerierung neu. Machen Sie nicht alles neu, die Stimmkonsistenz ist wichtiger als die Korrektur einer okay-aber-nicht-perfekten Zeile.
- Stabilität: 40 (etwas natürliche Variation, nicht zu instabil)
- Ähnlichkeit: 75
- Stil: 30-40 (wichtig für Erklärvideos, Satzzeichen beeinflussen tatsächlich die Lieferung)
- Sprecher-Boost: an
Schritt 4: Motion-Clips in Runway generieren (30 Minuten)
Generieren Sie für jeden „abstrakten Motion“-Beat in Ihrem Storyboard (ca. 5-8 Clips für ein 60-Sekunden-Video) einen 4-5 Sekunden langen Clip in Runway Gen-4.5.
Prompts, die für Erklärvideos funktionieren:
Verwenden Sie Referenzbilder aus Ihrer Marke für Konsistenz. Wenn Sie ein Logo haben, ziehen Sie es als Referenz in Runway und fordern Sie es auf, sich zu materialisieren. Wenn Sie einen Screenshot Ihrer UI haben, referenzieren Sie ihn und fordern Sie eine animierte Version an.
Für 5-8 Clips rechnen Sie damit, 15-25 Kandidaten zu generieren und die besten auszuwählen. KI-Video ist nicht deterministisch; rechnen Sie damit, 3-4 Mal pro Beat zu würfeln, um einen zu bekommen, der passt.
- „Abstrakte Datenpunkte fließen von links nach rechts über eine dunkle Oberfläche, sanfter Schein, minimal, 4 Sekunden“
- „Ein Logo, das aus Lichtpartikeln entsteht, dunkler Hintergrund, Premium-Tech-Feeling, 3 Sekunden“
- „Draufsicht auf einen sauberen Arbeitsplatz, Papiere werden von unsichtbaren Händen in ordentliche Stapel sortiert, sanftes Tageslicht, 5 Sekunden“
Schritt 5: Schnitt in CapCut (20 Minuten)
Hier kommen die meisten Erklärvideos zusammen oder fallen auseinander. Die Reihenfolge der Operationen ist wichtig:
Exportieren Sie in 1080x1920 (vertikal), 1920x1080 (quer) oder 1080x1080 (quadratisch), je nachdem, wo Sie posten werden. Für beste Ergebnisse exportieren Sie die Masterdatei im Querformat und rahmen Sie sie in CapCut für vertikale/quadratische Versionen neu ein.
- Legen Sie zuerst das Voiceover auf Spur 1. Immer. Die Stimme diktiert den Schnitt.
- Platzieren Sie jedes Bild dort, wo sein Satz beginnt. Verwenden Sie Marker auf der Timeline; CapCut zeigt sie deutlich an.
- Für UI-Bildschirmaufnahmen, beschleunigen Sie sie auf 1,5x oder 2x. Echte UI-Aufnahmen sind für einen 60-Sekunden-Schnitt zu langsam.
- Fügen Sie Hintergrundmusik bei -18 dB hinzu, damit das Voiceover klar darüber liegt. CapCuts Bibliothek bietet Tausende von kostenlosen, lizenzfreien Tracks; wählen Sie etwas Kinoreifes im Bereich von 100-115 BPM.
- Synchronisieren Sie die Schnitte mit der Musik mithilfe der Auto-Beat-Funktion von CapCut. Visuelle Änderungen zu Beats fühlen sich professionell an. Visuelle Änderungen zwischen Beats wirken amateurhaft.
- Fügen Sie statischen Screenshots subtile Bewegung hinzu, ein langsamer 5-Sekunden-Zoom, wechselnde Richtung über die Aufnahmen hinweg. Statische UI-Screenshots in einem Bewegtbild wirken leblos.
- Titelkarte am Anfang (0,5 Sek.) und Ende (1 Sek.). Nur Ihr Logo und die URL. Überladen Sie diese nicht.
Was das in der Praxis bedeutet
Das erste Erklärvideo dauert 3 Stunden. Das fünfte dauert exakt 60 Minuten.
Fehler, die Erklärvideos ruinieren
- KI-generierte Menschen. Selbst im Jahr 2026 lösen KI-Menschen in Erklärer-Rollen bei den meisten Zuschauern das Uncanny Valley aus. Verwenden Sie abstrakte Bewegungen, Produkt-UI oder echtes menschliches B-Roll aus einer Stock-Bibliothek, keine generierten Gesichter.
- Musik lauter als Stimme. Der häufigste Grund, warum ein Video amateurhaft wirkt. -18 dB Musik, Stimme bei 0 dB, niemals umgekehrt.
- Kein CTA. Ein poliertes Erklärvideo ohne klare Aufforderung lässt die Zuschauer ohne nächsten Schritt zurück. Beenden Sie immer mit einer spezifischen Aktion.
- Vertikales Denken bei einem Desktop-Produkt. Wenn Ihr CTA lautet „Gehen Sie zu [domain].com auf Ihrem Laptop“, ist vertikal nicht das richtige primäre Format. Erstellen Sie einen 16:9-Master, posten Sie einen vertikalen Schnitt als Teaser.
Wohin als Nächstes
Nachdem Ihr erstes Erklärvideo veröffentlicht wurde, sind die Upgrades:
Erstellen Sie die 60-Sekunden-Version dieses Wochenende. Veröffentlichen Sie sie. Beobachten Sie, wie sie konvertiert. Machen Sie dann die längere Version, sobald Sie wissen, welche 30 Sekunden die eigentliche Arbeit geleistet haben.
- Ein 30-Sekunden-Cut für bezahlte Social-Media-Anzeigen. Gleiches Skript, halbiert.
- Ein 3-minütiges Deep-Dive für Ihre Homepage und YouTube. Gleicher Workflow, mehr Clips, mehr Tiefe.
- Eine lokalisierte Version in 2-3 anderen Sprachen mit ElevenLabs Dubbing. Enormer Distributionsschub für fast keine zusätzliche Arbeit.