Text-zu-Video und Bild-zu-Video

Wie generative Videomodelle Szenen, Bewegung und teilweise Audio aus Beschreibungen oder Bildern erzeugen.

Wissensstufe: , Status: Zuletzt geprüft: 28.07.2026Primärquelle: Google DeepMind: Veo
Lesedauer: etwa 1 Min.Zur Übersicht

Videomodelle erzeugen zeitlich zusammenhängende Bildfolgen. Moderne Systeme können Text, Referenzbilder, Kamerabewegung, Szenenbeschreibung und teilweise Ton gemeinsam verarbeiten.

Was erzeugt werden kann

  • kurze Filmszenen und B-Roll
  • Animationen aus Standbildern
  • Produkt- und Konzeptvisualisierungen
  • Kamerafahrten und Übergänge
  • Video mit Dialog, Geräuschen oder Musik – abhängig vom System

Warum Video schwieriger ist als ein Einzelbild

Neben jedem einzelnen Frame muss das Modell auch Bewegung, zeitliche Kontinuität, Objektidentität, Physik und Kameraführung über die gesamte Sequenz berücksichtigen.

Prompt-Bestandteile

  • Motiv und Handlung
  • Ort und Zeit
  • Bildstil und Licht
  • Einstellungsgröße und Kamerabewegung
  • Dauer, Tempo und gewünschter Ton

Grenzen

Lange Szenen, genaue Handlungen, lesbare Texte und dauerhaft konsistente Details sind weiterhin anspruchsvoll. Professionelle Ergebnisse entstehen meist durch Auswahl, Schnitt und Nachbearbeitung.

Quellen und Prüfstand

Prüfstand: 28.07.2026. Produktfunktionen, Nutzungsbedingungen und Rechte können sich ändern und müssen vor einer Veröffentlichung beim jeweiligen Anbieter geprüft werden.