Veo 3 Tutorial auf Deutsch: KI-Videos mit Ton erstellen
· 3 Min. Lesezeit
KI-generiertes BildVeo 3 von Google war der erste große Video-Generator, der Bild und Ton gleichzeitig erzeugt. Kein Stummfilm mehr, sondern Clips mit Stimmen, Geräuschen und Atmosphäre. In diesem Tutorial zeigen wir euch, wie ihr in Deutschland loslegt und Prompts schreibt, die wirklich funktionieren.
Was ist Veo 3?
Veo 3 ist das Videomodell von Google DeepMind. Es wurde im Mai 2025 vorgestellt und kam im Juli 2025 nach Deutschland. Die Clips sind kurz, in der Regel um die acht Sekunden, haben dafür aber nativ erzeugten Ton. Mit der Weiterentwicklung Veo 3.1 kamen unter anderem Hochformat für Reels und Shorts, das Verlängern von Clips und Referenzbilder dazu.
Wo ihr Veo 3 in Deutschland nutzen könnt
- Gemini-App: Der einfachste Einstieg. Ihr tippt euren Prompt ein und bekommt ein Video zurück.
- Google Flow: Das Kreativstudio für Videos. Hier gibt es Kamerasteuerung, einen Szenen-Editor und eine Verwaltung für eure Elemente.
- Gemini API: Für Entwickler, die Veo in eigene Anwendungen einbauen wollen.
Für die Videofunktion braucht ihr ein kostenpflichtiges Google-AI-Abo. Wie viele Videos pro Tag drin sind, hängt vom Tarif ab. Schaut am besten direkt bei Google nach den aktuellen Limits.
Schritt für Schritt: Euer erstes Video
- Öffnet Gemini oder Flow und wählt die Videoerstellung aus.
- Legt das Format fest: Querformat für YouTube, Hochformat für TikTok, Reels und Shorts.
- Schreibt euren Prompt nach dem Schema weiter unten.
- Optional: Ladet ein Referenzbild hoch, damit Figur oder Produkt gleich aussehen.
- Generiert, schaut euch das Ergebnis an und passt den Prompt gezielt an, statt komplett neu anzufangen.
- Verlängert gute Clips oder baut daraus in Flow mehrere zusammenhängende Szenen.
So schreibt ihr gute Veo-3-Prompts
Je genauer ihr beschreibt, desto besser wird es. Bewährt hat sich diese Reihenfolge:
- Motiv: Wer oder was ist zu sehen?
- Handlung: Was passiert?
- Ort und Licht: Wo spielt es, welche Tageszeit, welche Stimmung?
- Kamera: Nahaufnahme, Totale, Kamerafahrt, Drohne?
- Ton: Was sagt die Figur, was hört man im Hintergrund?
Prompt-Vorlage zum Kopieren
Nahaufnahme einer jungen Frau in einem kleinen Café am Morgen, warmes Sonnenlicht fällt durchs Fenster. Sie schaut in die Kamera und sagt lächelnd: „Heute zeige ich euch meinen Lieblingstrick.“ Im Hintergrund klappern Tassen und eine Kaffeemaschine zischt. Langsame Kamerafahrt nach vorne, Hochformat.
Typische Fehler
- Zu viel auf einmal: Acht Sekunden reichen für eine Handlung, nicht für fünf.
- Dialog ohne Anführungszeichen: Setzt gesprochene Sätze in Anführungszeichen, dann erkennt das Modell sie als Sprache.
- Kein Ton beschrieben: Wenn ihr nichts zum Ton sagt, entscheidet das Modell selbst.
- Echte Personen: Videos von realen Menschen ohne Zustimmung sind tabu und werden blockiert.
Ideen für Creator und Marketing
- Hooks für Shorts und Reels, die in den ersten Sekunden fesseln. Mehr dazu in Perfekte Hooks.
- Produktszenen für Werbeanzeigen, siehe auch Virale UGC Ads mit KI.
- B-Roll für Faceless Videos.
- Szenen für Musikvideos, wie in Musikvideos mit KI erstellen.
Kennzeichnung nicht vergessen
Google versieht Veo-Videos mit einem sichtbaren Wasserzeichen und dem unsichtbaren SynthID-Wasserzeichen. Kennzeichnet KI-Videos auf Social Media trotzdem selbst, viele Plattformen verlangen das inzwischen ausdrücklich.
Häufige Fragen
Ist Veo 3 kostenlos?
Für die Videoerstellung braucht ihr ein kostenpflichtiges Google-AI-Abo. Die Anzahl der Videos ist je nach Tarif begrenzt.
Wie lang sind Veo-3-Videos?
Ein einzelner Clip dauert in der Regel etwa acht Sekunden. Längere Videos baut ihr durch Verlängern oder Aneinanderreihen.
Versteht Veo 3 deutsche Prompts?
Ja, ihr könnt auf Deutsch prompten und auch deutsche Dialoge sprechen lassen. Bei sehr komplexen Szenen liefern englische Prompts manchmal genauere Ergebnisse.

