Thema: Generative KI

  • Bilder aus Textbeschreibungen erzeugen

    Der Prozess eignet sich besonders für Ideenfindung und visuelle Prototypen. Rechte, Kennzeichnung, Stereotype und die korrekte Darstellung konkreter Details müssen geprüft werden.

    Geeignet für

    • Illustration
    • Konzeptentwicklung
    • Werbung
    • Storyboards

    Voraussetzungen

    Eine klare Bildidee, gewünschtes Format, Stilrichtung und zulässige Nutzungsbedingungen.

    Vorgehensweise

    1. Motiv, Bildaussage und Zielmedium festlegen.
    2. Komposition, Perspektive, Licht und Format beschreiben.
    3. Mehrere Varianten erzeugen.
    4. Fehler und unerwünschte Elemente markieren.
    5. Ausgewählte Variante bearbeiten und Rechte dokumentieren.

    Beispiel

    Für einen Artikel über Robotik entstehen drei sachliche Illustrationsvarianten im Querformat.

    Qualitätskontrolle

    • Hände, Schrift, Symbole und technische Details prüfen.
    • Keine realen Ereignisse täuschend darstellen.
    • Lizenz- und Herkunftsangaben dokumentieren.

    Grenzen und Risiken

    • Modelle können Logos, Texte oder reale Produkte fehlerhaft darstellen.
    • Trainingsdaten, Persönlichkeitsrechte und Urheberrecht können relevant sein.

    Passende Tools und Modelle

    Bildgeneratoren und integrierte Bildbearbeitungssysteme.

    Quellen und Leitlinien

  • Videos und Szenen mit KI vorbereiten

    Die Technik ist stark für Konzept, Previsualisierung und kurze Szenen. Konsistenz, Physik, Personen, Rechte und mögliche Täuschung müssen sorgfältig geprüft werden.

    Geeignet für

    • Storyboards
    • Werbung
    • Erklärvideos
    • Filmprototypen

    Voraussetzungen

    Ein klares Szenenkonzept, rechtmäßig nutzbare Referenzen und ein Plan für Schnitt und Ton.

    Vorgehensweise

    1. Ziel, Dauer und Bildformat festlegen.
    2. Szene in einzelne Einstellungen zerlegen.
    3. Referenzbilder und Bewegungsbeschreibung vorbereiten.
    4. Kurze Varianten erzeugen und auswählen.
    5. Schnitt, Ton, Kennzeichnung und Fakten prüfen.

    Beispiel

    Aus einer Produktillustration entsteht eine kurze Kamerafahrt als Entwurf für einen Werbeclip.

    Qualitätskontrolle

    • Gesichter, Hände, Logos, Bewegungen und Kontinuität prüfen.
    • Reale Personen und Ereignisse nicht täuschend darstellen.
    • Nutzungsrechte für Referenzmaterial und Ausgabe klären.

    Grenzen und Risiken

    • Längere Szenen können visuell inkonsistent werden.
    • Realistische Ausgaben können als echte Aufnahmen missverstanden werden.

    Passende Tools und Modelle

    Video- und Bild-zu-Video-Generatoren, Schnittprogramme und Audiowerkzeuge.

    Quellen und Leitlinien

  • ChatGPT

    ChatGPT ist ein KI-Dienst von OpenAI. Er verbindet dialogbasierte Textarbeit mit multimodalen Funktionen und kann – abhängig von der verfügbaren Produktversion – Dateien, Bilder und Sprache verarbeiten sowie Werkzeuge und agentische Abläufe nutzen.

    Funktionen

    • Fragen beantworten, Inhalte erklären, zusammenfassen und überarbeiten.
    • Dateien und Bilder analysieren sowie strukturierte Ergebnisse erzeugen.
    • Bilder erstellen und bearbeiten; Sprachdialoge und weitere multimodale Funktionen nutzen.
    • Je nach Produktversion recherchieren, Werkzeuge verwenden und mehrstufige Aufgaben bearbeiten.

    Stärken

    • Breites Aufgabenspektrum für Alltag, Lernen, Büro, Kreativität und Entwicklung.
    • Niedrige Einstiegshürde durch natürliche Sprache.
    • Verknüpfung verschiedener Medien und Arbeitsweisen in einer Oberfläche.

    Grenzen

    • Antworten können trotz überzeugender Formulierungen sachlich falsch oder unvollständig sein.
    • Aktuelle Funktionen, Modelle und Nutzungslimits ändern sich regelmäßig.
    • Folgenreiche Entscheidungen erfordern externe Quellen und fachliche Prüfung.

    Datenschutz und Nutzung

    Vertrauliche oder personenbezogene Informationen sollten nur entsprechend den gewählten Kontoeinstellungen, Vertragsbedingungen und internen Datenschutzregeln verarbeitet werden. Für Unternehmen sind die jeweils geltenden Produkt- und Datenkontrollen zu prüfen.

    Preismodell und Verfügbarkeit

    ChatGPT wird in verschiedenen Tarifen angeboten. Modelle, Werkzeuge, Limits und regionale Verfügbarkeit unterscheiden sich. Maßgeblich sind die aktuellen offiziellen Produkt- und Versionshinweise.

    Offizielle Quellen

  • Claude

    Claude ist der dialogbasierte KI-Dienst von Anthropic. Er wird für Schreiben, Analyse, Programmierung, umfangreiche Dokumente und – abhängig von Produkt und Tarif – Werkzeugnutzung sowie agentische Arbeitsabläufe eingesetzt.

    Funktionen

    • Texte analysieren, entwerfen, überarbeiten und strukturieren.
    • Dokumente und umfangreiche Kontexte bearbeiten.
    • Code erklären, erzeugen und in Entwicklungsumgebungen unterstützen.
    • Je nach Produktversion Werkzeuge, Computersteuerung und länger laufende Aufgaben nutzen.

    Stärken

    • Ausführliche Text- und Dokumentarbeit.
    • Starke Ausrichtung auf Analyse, Programmierung und professionelle Arbeitsabläufe.
    • API und Integrationen für eigene Anwendungen.

    Grenzen

    • Auch Claude kann halluzinieren und Quellen falsch einordnen.
    • Funktionsumfang und Modellzugang unterscheiden sich nach Tarif und Plattform.
    • Werkzeug- oder Computeraktionen benötigen Kontrolle und klare Berechtigungsgrenzen.

    Datenschutz und Nutzung

    Vor der Verarbeitung interner Dokumente sind die jeweils geltenden Datenbedingungen, Aufbewahrungseinstellungen und Unternehmensoptionen zu prüfen.

    Preismodell und Verfügbarkeit

    Claude ist als Web- und Mobilanwendung sowie über APIs und ausgewählte Cloud-Plattformen verfügbar. Tarife, Modelle und Limits ändern sich; maßgeblich sind die offiziellen Produktinformationen.

    Offizielle Quellen

  • Gemini

    Gemini ist Googles dialogbasierter KI-Dienst. Er unterstützt Schreiben, Planung, Ideensuche, Recherche und multimodale Aufgaben; einzelne Funktionen sind mit Google-Diensten und spezialisierten Kreativ- oder Forschungswerkzeugen verbunden.

    Funktionen

    • Texte erstellen, erklären, zusammenfassen und planen.
    • Bilder und andere Medien als Eingabe verstehen.
    • Je nach Tarif Deep Research, umfangreiche Kontexte und kreative Medienfunktionen nutzen.
    • Mit ausgewählten Google-Diensten und Arbeitsabläufen zusammenarbeiten.

    Stärken

    • Enge Einbindung in das Google-Ökosystem.
    • Multimodale Modellfamilie und mehrere Leistungs- und Kostenklassen.
    • Zugang über App, Web und Entwickler-API.

    Grenzen

    • Funktionen und Modelle unterscheiden sich nach Region, Tarif und Konto.
    • Rechercheausgaben müssen anhand der Originalquellen geprüft werden.
    • Integrationen können zusätzliche Zugriffsrechte auf persönliche oder geschäftliche Daten benötigen.

    Datenschutz und Nutzung

    Bei der Verbindung mit Google-Diensten ist genau zu prüfen, welche Datenquellen freigegeben werden und welche Kontoeinstellungen gelten.

    Preismodell und Verfügbarkeit

    Gemini ist in kostenlosen und kostenpflichtigen Angeboten verfügbar. Modellzugang, Limits und Zusatzfunktionen werden laufend angepasst.

    Offizielle Quellen

  • GitHub Copilot

    GitHub Copilot ist ein KI-gestützter Entwicklungsdienst. Er unterstützt beim Verstehen, Schreiben, Ändern und Prüfen von Code und kann je nach Produktstufe Aufgaben agentisch in Entwicklungsumgebungen oder auf GitHub bearbeiten.

    Funktionen

    • Codevervollständigung und Vorschläge für nächste Änderungen.
    • Chat und Erklärungen im Kontext eines Projekts.
    • Agentenmodus für Änderungen über mehrere Dateien, Tests und Validierung.
    • Code-Review, CLI-Unterstützung und asynchrone Aufgaben auf GitHub – abhängig vom Tarif.

    Stärken

    • Direkte Einbindung in verbreitete Entwicklungswerkzeuge.
    • Nutzung des vorhandenen Projektkontexts.
    • Unterstützung vom Entwurf bis zu Tests und Review.

    Grenzen

    • Generierter Code kann Fehler, Sicherheitsprobleme oder ungeeignete Abhängigkeiten enthalten.
    • Ergebnisse müssen getestet und von Entwicklern geprüft werden.
    • Funktionen, Modellwahl und Kontingente hängen vom Tarif ab.

    Datenschutz und Nutzung

    Organisationen sollten Ausschlussregeln, Richtlinien, Datenkontrollen und Rechte für Repository-Zugriffe festlegen.

    Preismodell und Verfügbarkeit

    GitHub Copilot wird in mehreren Tarifen für Einzelpersonen und Organisationen angeboten. Der genaue Funktionsumfang ist der aktuellen Tarifübersicht zu entnehmen.

    Offizielle Quellen

  • GPT-Modellfamilie

    Die GPT-Modellfamilie umfasst generative Modelle von OpenAI für Text, visuelle Eingaben, Programmierung, Reasoning und Werkzeugnutzung. Der konkrete Modellkatalog wird laufend aktualisiert; für technische Entscheidungen ist deshalb die offizielle Modellübersicht maßgeblich.

    Modelltyp und Fähigkeiten

    • Transformer-basierte generative Modelle für Text und weitere Modalitäten.
    • Unterstützung für mehrsprachige Aufgaben, visuelle Eingaben, Code und strukturierte Ausgaben – modellabhängig.
    • Werkzeugaufrufe, agentische Abläufe und unterschiedliche Reasoning-Stufen in aktuellen Modelllinien.

    Technische Einordnung

    GPT-Modelle erzeugen Ausgaben tokenweise auf Grundlage gelernter Wahrscheinlichkeitsverteilungen. Moderne Varianten kombinieren Vortraining, Nachtraining, Sicherheitsverfahren, Werkzeugnutzung und zusätzliche Laufzeitberechnung für komplexe Aufgaben.

    Verfügbarkeit und Zugang

    Der Zugang erfolgt über ChatGPT sowie über OpenAIs API. Modellnamen, Kontextgrößen, Preise und Endpunkte verändern sich; produktive Systeme sollten auf die offizielle Modellliste und Migrationshinweise abgestimmt werden.

    Benchmarks und Grenzen

    Benchmarks zeigen nur Ausschnitte der Leistung. Modelle können halluzinieren, bei ungewöhnlichen Verteilungen versagen und in agentischen Abläufen falsche Aktionen planen. Evaluationen müssen den realen Einsatzzweck, Kosten, Latenz und Sicherheitsanforderungen abbilden.

    Offizielle Quellen

  • Claude-Modellfamilie

    Die Claude-Modellfamilie von Anthropic umfasst Modelle mit unterschiedlichen Profilen für komplexes Reasoning, schnelle Aufgaben, Programmierung und agentische Abläufe. Konkrete Modellvarianten und Grenzwerte werden in der offiziellen Dokumentation gepflegt.

    Modelltyp und Fähigkeiten

    • Große Sprachmodelle für Text, Bilder, Code und Dokumentanalyse.
    • Unterschiedliche Modellklassen für maximale Leistungsfähigkeit, ausgewogene Nutzung und schnelle kosteneffiziente Aufgaben.
    • Werkzeugnutzung, strukturierte Ausgaben und agentische Arbeitsabläufe.

    Technische Einordnung

    Claude-Modelle sind generative Transformer-Systeme. Anthropic kombiniert Vortraining und Nachtraining mit Verfahren zur Steuerbarkeit und Sicherheit. Die Produktfamilie wird regelmäßig durch neue Modellgenerationen ersetzt oder ergänzt.

    Verfügbarkeit und Zugang

    Claude ist über Anthrophics API, die Claude-Anwendungen und ausgewählte Cloud-Plattformen verfügbar. Für stabile Integrationen sind konkrete Modell-IDs und Abschaltfristen zu beachten.

    Benchmarks und Grenzen

    Leistungsangaben sind abhängig von Aufgaben, Prompt, Werkzeugen und Evaluationsmethode. Auch leistungsfähige Varianten können Quellen erfinden, fehlerhafte Schlüsse ziehen oder Werkzeugaktionen falsch ausführen.

    Offizielle Quellen

  • Gemini-Modellfamilie

    Gemini bezeichnet Googles Familie multimodaler Modelle. Verschiedene Varianten sind auf hohe Leistungsfähigkeit, Geschwindigkeit, geringe Kosten, Echtzeit-Audio oder spezielle Aufgaben ausgerichtet.

    Modelltyp und Fähigkeiten

    • Multimodale Verarbeitung von Text, Bildern, Audio, Video und Code – abhängig vom Modell.
    • Unterschiedliche Pro-, Flash- und spezialisierte Varianten.
    • Werkzeugnutzung, lange Kontexte und Echtzeitanwendungen in ausgewählten Modellen.

    Technische Einordnung

    Gemini-Modelle werden als multimodale Foundation Models entwickelt. Die Modellfamilie umfasst verschiedene Größen und Laufzeitprofile; experimentelle Endpunkte können sich schneller ändern als stabile Varianten.

    Verfügbarkeit und Zugang

    Zugang besteht über die Gemini-Anwendungen, Google AI Studio, die Gemini API und Google-Cloud-Angebote. Für produktive Systeme sollten stabile Modellkennungen und offizielle Lebenszyklusangaben verwendet werden.

    Benchmarks und Grenzen

    Vergleiche zwischen Modellvarianten sind nur bei identischen Aufgaben und Einstellungen aussagekräftig. Multimodalität beseitigt weder Halluzinationen noch Fehler bei Bildern, langen Kontexten oder Werkzeugaktionen.

    Offizielle Quellen

  • Llama-Modellfamilie

    Llama ist eine von Meta entwickelte Modellfamilie mit veröffentlichten Gewichten. Sie wird für lokale, cloudbasierte und angepasste Anwendungen eingesetzt und umfasst Sprach- sowie multimodale Varianten.

    Modelltyp und Fähigkeiten

    • Generative Sprachmodelle für Text, Code, Reasoning und Werkzeugnutzung.
    • Multimodale Varianten für Text- und Bildverarbeitung.
    • Unterschiedliche Größen für Server, einzelne Beschleuniger und ressourcenärmere Umgebungen.

    Technische Einordnung

    Llama-Modelle sind Transformer-basierte Foundation Models. Open Weight bedeutet, dass Modellgewichte unter den jeweiligen Lizenzbedingungen heruntergeladen werden können; es bedeutet nicht automatisch uneingeschränktes Open Source.

    Verfügbarkeit und Zugang

    Modelle werden über Meta, Partnerplattformen und Modell-Repositories bereitgestellt. Lizenz, Hardwarebedarf, Quantisierung und Sicherheitskonfiguration müssen für den jeweiligen Einsatz geprüft werden.

    Benchmarks und Grenzen

    Lokale Kontrolle ist ein Vorteil, verlagert aber Verantwortung für Betrieb, Schutzmaßnahmen und Updates auf den Betreiber. Kleinere oder stark quantisierte Varianten können deutlich an Genauigkeit verlieren.

    Offizielle Quellen