So erstellen Sie in 30 Minuten ein virales KI-Video (Ausgabe 2026)
Ein Stack aus vier Tools und ein wiederholbares Skript, das eine einzelne Idee in ein poliertes, vertikales Video verwandelt, das zum Scrollen anregt – ohne Kamera, Gesicht oder Studio.
Im Jahr 2026 kann ein gesichtsloses 45-Sekunden-Video in einer Woche eine Million Aufrufe erzielen und Sie kostet es nichts außer der Zeit, die Sie zum Lesen dieser Anleitung benötigen. Die Tools sind leise gut genug geworden, dass der Engpass nicht mehr die KI-Qualität ist, sondern das Skript und der Rhythmus.
Dies ist der exakte Stack, den wir verwenden, um eine Ein-Zeilen-Idee in weniger als 30 Minuten in ein poliertes vertikales Video zu verwandeln. Keine Kamera. Kein Studio. Kein Gesicht auf dem Bildschirm erforderlich.
Der Vier-Tool-Stack
Sie benötigen genau vier Teile. Fügen Sie keine weiteren hinzu, jedes zusätzliche Tool frisst Zeit und zahlt sich bei einem 45-Sekunden-Clip nie aus.
Gesamte monatliche Kosten, wenn Sie 3 Kurzvideos pro Woche veröffentlichen: etwa 30 $. Derselbe Stack kostete vor einem Jahr über 100 $ und lieferte sichtbar schlechtere Ergebnisse.
- Eine Stimme, ElevenLabs v3 für die Erzählung.
- Ein Look, Midjourney für 9:16 B-Roll-Stills (oder Flux 2, wenn Sie niedrigere Kosten wünschen).
- Ein Editor, CapCut auf dem Desktop, kostenlos, schnell, mit integrierter Beat-Synchronisation.
- Ein Finisher, Submagic für Untertitel, Hooks und KI-B-Roll-Vorschläge.
Schritt 1: Schreiben Sie das 45-Sekunden-Skript (5 Minuten)
Öffnen Sie ein leeres Dokument und schreiben Sie drei Dinge:
Lesen Sie es laut vor und stoppen Sie die Zeit. Wenn es bei natürlichem Tempo länger als 45 Sekunden dauert, kürzen Sie Wörter. Vertikale Videos leben oder sterben von der Geschwindigkeit.
- Der Hook (erste 1,5 Sekunden Audio). Ein Satz, konträr oder neugierig. „Die meisten Leute verlieren Geld mit Bitcoin, weil sie kaufen, was ihre Freunde kaufen.“ Nicht „In diesem Video sprechen wir über…“, das wird in 0,4 Sekunden weggescrollt.
- Die Mitte (etwa 110-130 Wörter). Drei konkrete Punkte, jeder mit einem visuellen Element verbunden. Wenn Sie sich die B-Roll für einen Satz nicht vorstellen können, streichen Sie den Satz.
- Der CTA (1 Satz). Folge für X. Speichere für später. Kommentiere deine Meinung. Eine Aufforderung, niemals zwei.
Schritt 2: Generieren Sie das Voiceover (3 Minuten)
Öffnen Sie ElevenLabs und wählen Sie eine Stimme aus der v3-Bibliothek. Testen Sie drei Stimmen für den ersten Satz, bevor Sie sich entscheiden. Die Stimm-Passung ist wichtiger als die Stimmqualität. Eine gelangweilte „Premium“-Stimme wird eine enthusiastische „Okay“-Stimme jedes Mal ausstechen.
Einstellungen, die für Kurzvideos gut funktionieren:
Generieren Sie, hören Sie einmal zu und rollen Sie nur neu, wenn ein bestimmtes Wort falsch ausgesprochen wird. Jagen Sie nicht nach Perfektion, Zuschauer tun das nicht.
- Stabilität: 35-45 (ein Hauch von Variation wirkt menschlich)
- Ähnlichkeit: 75
- Stil: 20-30, wenn Ihr Skript Betonungen hat, 0, wenn es eine ruhige Erklärung ist
Schritt 3: Generieren Sie B-Roll-Stills (10 Minuten)
Hier verschwenden die meisten Ersteller eine Stunde. Die Lösung besteht darin, sich von Anfang an auf einen einzigen visuellen Stil festzulegen und eine Midjourney-Stilreferenz (--sref) bei jedem Prompt wiederzuverwenden.
Workflow:
Sie erhalten eine visuell kohärente Sammlung vertikaler Stills, die aussehen, als kämen sie von einem einzigen Art Director. Das trennt ein gutes KI-Video von einem, das nach „KI-Matsch“ schreit.
Wenn Midjourneys Preis für Ihr Ausgabevolumen nicht gerechtfertigt ist, erledigt Flux 2 80 % der gleichen Arbeit zu einem Bruchteil der Kosten, etwas weniger stilisiert, aber für Kurzvideos gut genug.
- Generieren Sie ein „Hero“-Bild, das Ihnen gefällt. Kopieren Sie seinen --sref-Wert.
- Schreiben Sie für jede Zeile Ihres Skripts einen Prompt. Hängen Sie --ar 9:16 --style raw --sref <Ihr-Code> an alle an.
- Führen Sie sie im Stapel aus. Wählen Sie die beste Variante jeder aus. Skalieren Sie noch nicht hoch.
- Skalieren Sie nur die 8-12 hoch, die Sie tatsächlich verwenden werden.
Schritt 4: Bearbeiten in CapCut (8 Minuten)
Legen Sie zuerst das Voiceover auf die Timeline. Immer zuerst die Stimme, dann die Bilder. Der Ton diktiert den Schnitt, nicht umgekehrt.
Dann:
Exportieren Sie in 1080×1920, 60fps. Versenden Sie 2026 keine 30fps.
Möchten Sie stattdessen eine traditionelle Desktop-Timeline? Wondershare Filmora bietet denselben Beat-Sync-Auto-Cut auf einem konventionelleren Editor, etwas langsamer für reine 45-Sekunden-Kurzvideos, aber besser, wenn Sie nebenbei auch längere Videos bearbeiten.
- Platzieren Sie jedes B-Roll-Bild auf dem Beat, wo sein Satz beginnt.
- Verwenden Sie Auto-Schnitt auf Beat für Hintergrundmusik. CapCuts Beat-Erkennung ist im Jahr 2026 schockierend gut.
- Fügen Sie jedem Still eine subtile Bewegung hinzu: 5-Sekunden-langsamer Zoom, wechselnde Richtungen. Statische Bilder auf einem vertikalen Bildschirm wirken nach 2 Sekunden tot.
- Verwenden Sie für Hintergrundmusik die Bibliothek von CapCut und wählen Sie etwas bei 110-120 BPM mit einer niedrigen Ducking-Lautstärke, damit das Voiceover im Vordergrund bleibt.
Schritt 5: Untertitel und Hook in Submagic (3 Minuten)
Laden Sie Ihren CapCut-Export in Submagic hoch. Drei Dinge zu tun:
Exportieren. Sie sind fertig.
- Wählen Sie eine Untertitelvorlage, die zu Ihrem Kanal passt. Fett, animiert, Betonung einzelner Wörter funktioniert am besten für Bildungsinhalte. Wort-für-Wort-Enthüllung funktioniert am besten für Storytelling.
- Verwenden Sie den KI-Hook-Generator für Ihre ersten 1,5 Sekunden. Er schreibt Ihren Hook in 3-5 Alternativen um, wählen Sie die prägnanteste. Dieser einzelne Schritt ist das Abonnement von Submagic wert.
- Akzeptieren Sie B-Roll-Vorschläge sparsam. Die KI schlägt manchmal einen Stock-Clip vor, der einen Beat wirklich verbessert, akzeptieren Sie diese, ignorieren Sie den Rest.
Was das in der Praxis bedeutet
Eine typische Sitzung, von Anfang bis Ende:
Das erste Video, das Sie erstellen, dauert 90 Minuten, weil Sie die Tools lernen. Das fünfte dauert 25.
Fehler, die die Reichweite zerstören
Einige Muster, die wir sehen und die ansonsten gute Kurzvideos zerstören:
- Inkonsistenter visueller Stil. Deshalb ist --sref wichtig. Fotorealismus und Illustration in einem Kurzvideo zu mischen, wirkt amateurhaft, auch wenn einzelne Aufnahmen gut sind.
- Generische Untertitel. Wenn Ihre Untertitel nur transkribierter Text in einer Standard-Schriftart sind, verlieren Sie 30 % der Abschlussrate gegenüber einer gestalteten Untertitelvorlage.
- Zwei CTAs. „Folgen UND kommentieren UND speichern“ trainiert den Algorithmus, zu denken, Ihr Publikum tut nichts. Nur eine Aufforderung.
- Laute Musik. Wenn Ihr Voiceover nicht 12-15 dB über der Musik liegt, wischen die Zuschauer weg.
- Keine Hook-Variante. Submagic generiert 5 Hook-Alternativen in 10 Sekunden. Der Standard-Skript-Hook ist fast nie der beste.
Wohin als Nächstes
Sobald Sie 10 Kurzvideos mit diesem Stack erstellt haben, verlagert sich der Engpass von „Kann ich ein Video erstellen?“ zu „Kann ich Ideen finden, die es wert sind, erstellt zu werden?“. Das ist das schwierigere Problem, aber es ist das Problem, das es wert ist, gelöst zu werden.
Fürs Erste, liefern Sie einfach das erste Video aus. Heute.