Veo 3.1

Veo 3.1 ist Googles generatives Videomodell für Text-zu-Video, Bild-zu-Video und die gemeinsame Erzeugung von Bild und Audio.

Wissensstufe: , Status: Zuletzt geprüft: 28.07.2026Primärquelle: Google DeepMind – Veo
Lesedauer: etwa 1 Min.Zur Übersicht

Veo 3.1 ist ein Videogenerierungsmodell von Google DeepMind. Es erzeugt Videos aus Text oder Bildern und kann Bild, Umgebungsgeräusche, Effekte und Dialog gemeinsam generieren.

Modelltyp und Fähigkeiten

  • Text-zu-Video und Bild-zu-Video.
  • Native Erzeugung von Ton, Geräuschen und Dialog zusammen mit dem Video.
  • Steuerung von Stil, Kameraführung, Bewegung und visueller Kontinuität.
  • Kennzeichnung generierter Inhalte mit Googles SynthID-Technologie.

Technische Einordnung

Veo gehört zu generativen Videomodellen, die räumliche und zeitliche Bildfolgen modellieren. Die Audio-Video-Generierung erweitert die Aufgabe um zeitlich passende akustische Signale.

Verfügbarkeit und Zugang

Veo ist über ausgewählte Google-Produkte und Entwicklerzugänge verfügbar. Zugang, Auflösung, Länge, Limits und regionale Verfügbarkeit hängen vom Produkt und Tarif ab.

Benchmarks und Grenzen

Herstellervergleiche und Präferenztests bilden nicht alle realen Produktionsbedingungen ab. Physik, Text im Bild, längere Handlungslogik, wiederkehrende Personen und präzise Schnittkontrolle können weiterhin Fehler zeigen.

Offizielle Quellen