Medium oder Format: Bild

  • Llama-Modellfamilie

    Llama ist eine von Meta entwickelte Modellfamilie mit veröffentlichten Gewichten. Sie wird für lokale, cloudbasierte und angepasste Anwendungen eingesetzt und umfasst Sprach- sowie multimodale Varianten.

    Modelltyp und Fähigkeiten

    • Generative Sprachmodelle für Text, Code, Reasoning und Werkzeugnutzung.
    • Multimodale Varianten für Text- und Bildverarbeitung.
    • Unterschiedliche Größen für Server, einzelne Beschleuniger und ressourcenärmere Umgebungen.

    Technische Einordnung

    Llama-Modelle sind Transformer-basierte Foundation Models. Open Weight bedeutet, dass Modellgewichte unter den jeweiligen Lizenzbedingungen heruntergeladen werden können; es bedeutet nicht automatisch uneingeschränktes Open Source.

    Verfügbarkeit und Zugang

    Modelle werden über Meta, Partnerplattformen und Modell-Repositories bereitgestellt. Lizenz, Hardwarebedarf, Quantisierung und Sicherheitskonfiguration müssen für den jeweiligen Einsatz geprüft werden.

    Benchmarks und Grenzen

    Lokale Kontrolle ist ein Vorteil, verlagert aber Verantwortung für Betrieb, Schutzmaßnahmen und Updates auf den Betreiber. Kleinere oder stark quantisierte Varianten können deutlich an Genauigkeit verlieren.

    Offizielle Quellen

  • Mistral-Modellfamilie

    Die Mistral-Modellfamilie umfasst Open-Weight- und kommerzielle Modelle mit unterschiedlichen Größen und Spezialisierungen. Sie kann über APIs, Cloud-Dienste oder teilweise selbst betrieben werden.

    Modelltyp und Fähigkeiten

    • Sprachmodelle für Text, Reasoning, Code und Werkzeugnutzung.
    • Spezialisierte Modelle und Dienste für Dokumentverarbeitung, OCR und Embeddings.
    • Unterschiedliche offene und kommerzielle Bereitstellungsformen.

    Technische Einordnung

    Mistral entwickelt Transformer-basierte Modelle mit verschiedenen Leistungs-, Größen- und Lizenzprofilen. Der Modellkatalog wird fortlaufend aktualisiert und enthält allgemeine sowie spezialisierte Endpunkte.

    Verfügbarkeit und Zugang

    Zugang erfolgt über Mistrals API und Plattform, Cloud-Partner oder bei ausgewählten Open-Weight-Modellen durch eigenen Betrieb. Lizenz und Modellkarte sind pro Variante zu prüfen.

    Benchmarks und Grenzen

    Modellgröße allein bestimmt nicht die Eignung. Sprachabdeckung, Kontext, Werkzeugunterstützung, Hardwarebedarf und reale Evaluationen sind entscheidend. Auch selbst betriebene Modelle benötigen Schutzmaßnahmen gegen Datenabfluss und missbräuchliche Eingaben.

    Offizielle Quellen

  • FLUX-Modellfamilie

    FLUX bezeichnet eine Familie generativer und visueller Modelle von Black Forest Labs. Sie wird für Text-zu-Bild, kontrollierte Bildbearbeitung und – in neueren Entwicklungsstufen – multimodale visuelle Systeme eingesetzt.

    Modelltyp und Fähigkeiten

    • Bilder aus Textbeschreibungen erzeugen.
    • Bilder mit Referenzen, Strukturvorgaben und speziellen Werkzeugen kontrolliert verändern.
    • Varianten für hohe Qualität, Entwicklung, schnelle Generierung und API-Nutzung.

    Technische Einordnung

    FLUX-Modelle basieren auf generativen Flow- beziehungsweise Diffusionsansätzen für visuelle Daten. Die Familie umfasst kommerzielle API-Varianten und teilweise offen zugängliche Gewichte mit unterschiedlichen Lizenzen.

    Verfügbarkeit und Zugang

    Zugang besteht über die BFL API, Partnerdienste und je nach Modell über veröffentlichte Gewichte. Neu angekündigte Generationen können zunächst als Early Access oder eingeschränkte Vorschau verfügbar sein.

    Benchmarks und Grenzen

    Bildqualität hängt stark von Prompt, Seitenverhältnis, Referenzen und Nachbearbeitung ab. Textdarstellung, räumliche Logik, Hände, wiederkehrende Identitäten und Rechtefragen bleiben relevante Prüfpunkte.

    Offizielle Quellen

  • ChatGPT

    ChatGPT ist ein KI-Dienst von OpenAI. Er verbindet dialogbasierte Textarbeit mit multimodalen Funktionen und kann – abhängig von der verfügbaren Produktversion – Dateien, Bilder und Sprache verarbeiten sowie Werkzeuge und agentische Abläufe nutzen.

    Funktionen

    • Fragen beantworten, Inhalte erklären, zusammenfassen und überarbeiten.
    • Dateien und Bilder analysieren sowie strukturierte Ergebnisse erzeugen.
    • Bilder erstellen und bearbeiten; Sprachdialoge und weitere multimodale Funktionen nutzen.
    • Je nach Produktversion recherchieren, Werkzeuge verwenden und mehrstufige Aufgaben bearbeiten.

    Stärken

    • Breites Aufgabenspektrum für Alltag, Lernen, Büro, Kreativität und Entwicklung.
    • Niedrige Einstiegshürde durch natürliche Sprache.
    • Verknüpfung verschiedener Medien und Arbeitsweisen in einer Oberfläche.

    Grenzen

    • Antworten können trotz überzeugender Formulierungen sachlich falsch oder unvollständig sein.
    • Aktuelle Funktionen, Modelle und Nutzungslimits ändern sich regelmäßig.
    • Folgenreiche Entscheidungen erfordern externe Quellen und fachliche Prüfung.

    Datenschutz und Nutzung

    Vertrauliche oder personenbezogene Informationen sollten nur entsprechend den gewählten Kontoeinstellungen, Vertragsbedingungen und internen Datenschutzregeln verarbeitet werden. Für Unternehmen sind die jeweils geltenden Produkt- und Datenkontrollen zu prüfen.

    Preismodell und Verfügbarkeit

    ChatGPT wird in verschiedenen Tarifen angeboten. Modelle, Werkzeuge, Limits und regionale Verfügbarkeit unterscheiden sich. Maßgeblich sind die aktuellen offiziellen Produkt- und Versionshinweise.

    Offizielle Quellen

  • Generative KI

    Generative KI berechnet neue Inhalte, die zu einer Eingabe und zu den im Training gelernten Mustern passen. Sie ruft dabei nicht einfach einen fertigen Text oder ein fertiges Bild aus einer Datenbank ab.

    Einfach erklärt

    Ein generatives Modell lernt, wie bestimmte Daten typischerweise aufgebaut sind. Ein Sprachmodell lernt Muster in Texten. Ein Bildmodell lernt statistische Zusammenhänge zwischen Bildinhalten und Beschreibungen. Aus einer neuen Anweisung erzeugt es dann eine neue Ausgabe.

    Das Ergebnis kann originell wirken, bleibt aber eine mathematisch erzeugte Kombination gelernter Strukturen. Es besitzt keine automatische Garantie für Wahrheit, Urheberrechtsfreiheit oder Eignung.

    Anschauliches Beispiel

    Bei der Eingabe „eine technische Zeichnung eines freundlichen Haushaltsroboters“ erzeugt ein Bildmodell keine Fotografie aus einem Archiv. Es startet je nach Modelltyp mit Rauschen oder einer latenten Repräsentation und formt daraus schrittweise ein Bild, das zur Beschreibung passt.

    Fortgeschrittene Erklärung

    Zu generativen Modellklassen gehören autoregressive Modelle, Diffusionsmodelle, Variational Autoencoder und Generative Adversarial Networks. Autoregressive Sprachmodelle erzeugen Sequenzen schrittweise. Diffusionsmodelle lernen, Rauschen zu entfernen und daraus strukturierte Daten zu rekonstruieren.

    Die Ausgabe wird durch Eingabe, Kontext, Sampling-Verfahren, Modellparameter und Sicherheitsmechanismen beeinflusst. Unterschiedliche Einstellungen können bei derselben Eingabe unterschiedliche Ergebnisse erzeugen.

    Expertenwissen

    Generative Modelle approximieren eine Datenverteilung oder eine bedingte Verteilung. Beim Sampling werden neue Beispiele aus dieser gelernten Verteilung erzeugt. Bei Foundation Models wird ein breit trainiertes Basismodell für viele Aufgaben genutzt und durch Prompting, Fine-Tuning, Retrieval oder Werkzeuge angepasst.

    NIST beschreibt für generative KI unter anderem Risiken wie Konfabulationen, Datenschutzverletzungen, schädliche Verzerrungen, Informationsintegrität, Sicherheitsprobleme und problematische Mensch-System-Konfigurationen.

    Möglichkeiten und Grenzen

    • Erzeugung und Bearbeitung von Text, Bild, Audio, Video, 3D und Code.
    • Schnelle Variantenbildung, Entwürfe und Unterstützung kreativer Prozesse.
    • Ausgaben können sachlich falsch, verzerrt oder rechtlich problematisch sein.
    • Vertrauliche Daten dürfen nicht ungeprüft an externe Dienste übermittelt werden.
    • Qualitätskontrolle und Quellenprüfung bleiben erforderlich.

    Quellen

  • Embeddings und Vektorsuche

    Ein Embedding übersetzt Text, Bilder oder andere Daten in eine Zahlenliste. In diesem Vektorraum lassen sich ähnliche Inhalte suchen, gruppieren und miteinander vergleichen.

    Einfach erklärt

    Ein Computer kann Bedeutungen nicht direkt mit menschlichen Begriffen vergleichen. Ein Embedding macht aus einem Inhalt einen Punkt in einem mehrdimensionalen Raum.

    Texte mit ähnlicher Bedeutung landen häufig näher beieinander als inhaltlich unterschiedliche Texte. So kann eine Suche passende Abschnitte finden, auch wenn nicht exakt dieselben Wörter vorkommen.

    Anschauliches Beispiel

    Eine Suche nach „Wie kann ich mein Passwort ändern?“ kann auch einen Abschnitt mit der Überschrift „Zugangsdaten zurücksetzen“ finden. Die Begriffe sind nicht identisch, ihre Bedeutungen können im Embedding-Raum aber ähnlich repräsentiert sein.

    Fortgeschrittene Erklärung

    Embeddings werden von trainierten Modellen erzeugt. Die Ähnlichkeit zweier Vektoren wird häufig mit Kosinusähnlichkeit oder einer Distanzfunktion gemessen. Vektordatenbanken speichern viele Embeddings und ermöglichen eine effiziente Suche nach den nächstgelegenen Einträgen.

    Embeddings werden für semantische Suche, Clustering, Empfehlungen, Duplikaterkennung und Retrieval-Augmented Generation eingesetzt.

    Expertenwissen

    Frühe Verfahren wie Word2Vec lernten statische Wortvektoren aus Kontextbeziehungen. Neuere Transformer-basierte Modelle erzeugen kontextabhängige Repräsentationen für Wörter, Sätze, Dokumente oder mehrere Modalitäten.

    Die Qualität einer Vektorsuche hängt von Modell, Segmentierung, Indexverfahren, Ähnlichkeitsmetrik, Sprache und Domäne ab. Nähe im Vektorraum ist ein statistisches Signal, kein Beweis für sachliche Gleichheit.

    Möglichkeiten und Grenzen

    • Semantische Suche ohne exakte Stichwortübereinstimmung.
    • Verknüpfung von Text und Bildern in gemeinsamen Repräsentationsräumen.
    • Ähnliche, aber sachlich unterschiedliche Inhalte können verwechselt werden.
    • Sensible Inhalte bleiben auch in Vektorform schutzbedürftig.

    Quellen

  • Diffusionsmodelle

    Ein Diffusionsmodell kann aus Rauschen schrittweise ein strukturiertes Bild oder andere Daten erzeugen. Es hat im Training gelernt, wie verrauschte Beispiele wieder in plausible Daten zurückgeführt werden.

    Einfach erklärt

    Im Training wird ein Bild zunehmend verrauscht. Das Modell lernt für viele Rauschstufen, wie es einen kleinen Teil dieses Rauschens wieder entfernen kann.

    Bei der Erzeugung beginnt das System mit Rauschen und wiederholt den gelernten Entrauschungsschritt. Eine Texteingabe kann den Prozess in Richtung eines gewünschten Motivs steuern.

    Anschauliches Beispiel

    Aus einer zufälligen Pixelwolke entstehen zuerst grobe Flächen, dann Formen, Objekte und Details. Der Prozess ist nicht mit dem Freilegen eines versteckten fertigen Bildes gleichzusetzen; das Bild wird während der Berechnung erzeugt.

    Fortgeschrittene Erklärung

    Denoising Diffusion Probabilistic Models definieren einen Vorwärtsprozess, der Daten schrittweise in Rauschen überführt, und einen gelernten Rückwärtsprozess. In praktischen Bildsystemen findet die Diffusion häufig in einem komprimierten latenten Raum statt.

    Konditionierung kann über Text-Embeddings, Bilder, Kanten, Tiefenkarten oder andere Steuersignale erfolgen. Dadurch sind Text-zu-Bild, Bildvariation, Inpainting und strukturell kontrollierte Erzeugung möglich.

    Expertenwissen

    Der Rückwärtsprozess approximiert bedingte Übergangsverteilungen beziehungsweise eine Score-Funktion. Die Trainingsziele können auf Rauschvorhersage, Datenvorhersage oder andere Parametrisierungen ausgerichtet sein.

    Sampling-Verfahren beeinflussen Geschwindigkeit, Qualität und Reproduzierbarkeit. Weniger Schritte beschleunigen die Erzeugung, können aber Detailtreue und Stabilität verändern.

    Möglichkeiten und Grenzen

    • Hochwertige Erzeugung und Bearbeitung von Bildern sowie zunehmend weiterer Modalitäten.
    • Gezielte Steuerung über Text und zusätzliche Kontrollsignale.
    • Details, Textdarstellung und räumliche Konsistenz können fehlerhaft sein.
    • Trainingsdaten, Urheberrecht, Identitätsmissbrauch und Deepfakes erfordern klare Regeln.

    Quellen

  • Multimodale KI

    Ein multimodales KI-System kann mehrere Medienarten miteinander verknüpfen. Es kann beispielsweise ein Bild analysieren, eine Frage dazu verstehen und eine gesprochene Antwort erzeugen.

    Einfach erklärt

    Menschen nehmen die Welt nicht nur als Text wahr. Multimodale Systeme verbinden verschiedene Formen von Information – zum Beispiel Wörter, Bilder, Töne, Videos oder Sensordaten.

    Dadurch kann ein System Inhalte zwischen Modalitäten übersetzen: ein Bild beschreiben, Sprache transkribieren, aus Text ein Bild erzeugen oder Video und Ton gemeinsam auswerten.

    Anschauliches Beispiel

    Ein Nutzer fotografiert eine defekte Maschine und stellt dazu eine gesprochene Frage. Ein multimodales System kann Bild und Sprache gemeinsam verarbeiten und eine textliche oder gesprochene Hilfestellung erzeugen. Für eine verlässliche Diagnose wären jedoch technische Dokumente und fachliche Prüfung nötig.

    Fortgeschrittene Erklärung

    Multimodale Modelle verwenden Encoder und Decoder für unterschiedliche Datentypen oder eine gemeinsame Tokenrepräsentation. Kontrastives Lernen kann Bild- und Textrepräsentationen in einem gemeinsamen Raum ausrichten.

    Vision-Language-Modelle kombinieren visuelle Merkmale mit Sprachmodellen. Weitere Systeme integrieren Audio, Video, 3D oder Roboteraktionen.

    Expertenwissen

    CLIP zeigte, wie Bild- und Textencoder durch kontrastives Lernen auf große Mengen gepaarter Bild-Text-Daten ausgerichtet werden können. Flamingo verband vortrainierte visuelle und sprachliche Komponenten für flexible visuelle Fragebeantwortung und Few-Shot-Lernen.

    Aktuelle Systeme unterscheiden sich stark darin, ob Modalitäten nativ gemeinsam trainiert, über Adapter verbunden oder über getrennte Spezialmodelle orchestriert werden. Multimodalität allein garantiert weder räumliches Verständnis noch physikalische Korrektheit.

    Möglichkeiten und Grenzen

    • Barrierefreiheit durch Bildbeschreibung, Transkription und Sprachausgabe.
    • Medienproduktion, visuelle Recherche und technische Assistenz.
    • Fehler können sich aus mehreren Modalitäten gegenseitig verstärken.
    • Bilder, Stimmen und Videos erhöhen Datenschutz- und Identitätsrisiken.
    • Sensordaten benötigen domänenspezifische Validierung.

    Quellen

  • Halluzinationen und Konfabulationen

    Ein KI-System kann eine flüssige und selbstbewusste Antwort erzeugen, obwohl Angaben erfunden, verwechselt oder nicht belegt sind. Sprachqualität und sachliche Richtigkeit sind getrennte Eigenschaften.

    Einfach erklärt

    Ein Sprachmodell berechnet wahrscheinliche Fortsetzungen. Es prüft nicht automatisch in einer verlässlichen Datenbank, ob jede Aussage stimmt.

    Darum kann es Quellen, Namen, Zahlen oder Ereignisse erfinden. Die Antwort klingt oft überzeugend, weil das Modell gut darin ist, sprachlich passende Muster zu erzeugen.

    Anschauliches Beispiel

    Bei der Frage nach einem seltenen Gerichtsurteil kann ein Modell einen plausibel klingenden Aktennamen und eine Zusammenfassung erzeugen, obwohl das Urteil nicht existiert. Ohne Prüfung in einer echten Rechtsdatenbank bleibt die Antwort unzuverlässig.

    Fortgeschrittene Erklärung

    NIST bezeichnet die selbstbewusste Erzeugung falscher oder irreführender Inhalte als Konfabulation. In der Forschung wird häufig weiterhin der Begriff Halluzination verwendet.

    Ursachen können unvollständige Trainingsdaten, mehrdeutige Eingaben, Sampling, fehlender Zugriff auf aktuelle Quellen, fehlerhaftes Retrieval oder ein Konflikt zwischen hilfreicher Formulierung und Unsicherheit sein.

    Expertenwissen

    Halluzinationen werden je nach Aufgabe unterschiedlich definiert: als Widerspruch zu einer Quelle, als nicht durch eine Quelle gestützte Aussage oder als faktisch falscher Inhalt. Entsprechend unterscheiden sich Messverfahren und Gegenmaßnahmen.

    RAG, Werkzeugzugriff, strengere Ausgabestrukturen, Kalibrierung, Verifikationsschritte und menschliche Prüfung können Risiken verringern, beseitigen sie aber nicht vollständig.

    Möglichkeiten und Grenzen

    • Fakten, Zitate, Quellen, Zahlen und aktuelle Angaben immer prüfen.
    • Für Recherche Originalquellen verlangen und tatsächlich öffnen.
    • Bei fehlender Evidenz sollte das System Unsicherheit ausweisen oder nicht antworten.
    • Medizinische, rechtliche, finanzielle und sicherheitskritische Entscheidungen nicht auf ungeprüfte Ausgaben stützen.

    Quellen