Gemini-Modellfamilie

Gemini ist Googles multimodale Modellfamilie für Text, Bilder, Audio, Video, Code und agentische Anwendungen.

Wissensstufe: , Status: Zuletzt geprüft: 28.07.2026Primärquelle: Google – Gemini Modellübersicht

Gemini bezeichnet Googles Familie multimodaler Modelle. Verschiedene Varianten sind auf hohe Leistungsfähigkeit, Geschwindigkeit, geringe Kosten, Echtzeit-Audio oder spezielle Aufgaben ausgerichtet.

Modelltyp und Fähigkeiten

  • Multimodale Verarbeitung von Text, Bildern, Audio, Video und Code – abhängig vom Modell.
  • Unterschiedliche Pro-, Flash- und spezialisierte Varianten.
  • Werkzeugnutzung, lange Kontexte und Echtzeitanwendungen in ausgewählten Modellen.

Technische Einordnung

Gemini-Modelle werden als multimodale Foundation Models entwickelt. Die Modellfamilie umfasst verschiedene Größen und Laufzeitprofile; experimentelle Endpunkte können sich schneller ändern als stabile Varianten.

Verfügbarkeit und Zugang

Zugang besteht über die Gemini-Anwendungen, Google AI Studio, die Gemini API und Google-Cloud-Angebote. Für produktive Systeme sollten stabile Modellkennungen und offizielle Lebenszyklusangaben verwendet werden.

Benchmarks und Grenzen

Vergleiche zwischen Modellvarianten sind nur bei identischen Aufgaben und Einstellungen aussagekräftig. Multimodalität beseitigt weder Halluzinationen noch Fehler bei Bildern, langen Kontexten oder Werkzeugaktionen.

Offizielle Quellen