Gemini bezeichnet Googles Familie multimodaler Modelle. Verschiedene Varianten sind auf hohe Leistungsfähigkeit, Geschwindigkeit, geringe Kosten, Echtzeit-Audio oder spezielle Aufgaben ausgerichtet.
Modelltyp und Fähigkeiten
- Multimodale Verarbeitung von Text, Bildern, Audio, Video und Code – abhängig vom Modell.
- Unterschiedliche Pro-, Flash- und spezialisierte Varianten.
- Werkzeugnutzung, lange Kontexte und Echtzeitanwendungen in ausgewählten Modellen.
Technische Einordnung
Gemini-Modelle werden als multimodale Foundation Models entwickelt. Die Modellfamilie umfasst verschiedene Größen und Laufzeitprofile; experimentelle Endpunkte können sich schneller ändern als stabile Varianten.
Verfügbarkeit und Zugang
Zugang besteht über die Gemini-Anwendungen, Google AI Studio, die Gemini API und Google-Cloud-Angebote. Für produktive Systeme sollten stabile Modellkennungen und offizielle Lebenszyklusangaben verwendet werden.
Benchmarks und Grenzen
Vergleiche zwischen Modellvarianten sind nur bei identischen Aufgaben und Einstellungen aussagekräftig. Multimodalität beseitigt weder Halluzinationen noch Fehler bei Bildern, langen Kontexten oder Werkzeugaktionen.