Veo 3.1 ist ein Videogenerierungsmodell von Google DeepMind. Es erzeugt Videos aus Text oder Bildern und kann Bild, Umgebungsgeräusche, Effekte und Dialog gemeinsam generieren.
Modelltyp und Fähigkeiten
- Text-zu-Video und Bild-zu-Video.
- Native Erzeugung von Ton, Geräuschen und Dialog zusammen mit dem Video.
- Steuerung von Stil, Kameraführung, Bewegung und visueller Kontinuität.
- Kennzeichnung generierter Inhalte mit Googles SynthID-Technologie.
Technische Einordnung
Veo gehört zu generativen Videomodellen, die räumliche und zeitliche Bildfolgen modellieren. Die Audio-Video-Generierung erweitert die Aufgabe um zeitlich passende akustische Signale.
Verfügbarkeit und Zugang
Veo ist über ausgewählte Google-Produkte und Entwicklerzugänge verfügbar. Zugang, Auflösung, Länge, Limits und regionale Verfügbarkeit hängen vom Produkt und Tarif ab.
Benchmarks und Grenzen
Herstellervergleiche und Präferenztests bilden nicht alle realen Produktionsbedingungen ab. Physik, Text im Bild, längere Handlungslogik, wiederkehrende Personen und präzise Schnittkontrolle können weiterhin Fehler zeigen.