Medium oder Format: Bild

  • Daten aus Formularen und Dokumenten extrahieren

    Die Technik eignet sich für wiederkehrende Dokumenttypen. Schlechte Scans, wechselnde Layouts und handschriftliche Inhalte erhöhen die Fehlerquote und erfordern Kontrollen.

    Geeignet für

    • Rechnungen
    • Formulare
    • Verträge
    • Berichte

    Voraussetzungen

    Rechtmäßig nutzbare Dokumente, ein definiertes Zielschema und Regeln für personenbezogene Daten.

    Vorgehensweise

    1. Dokumenttypen und benötigte Felder definieren.
    2. Beispiele mit Sollwerten zusammenstellen.
    3. Extraktion durchführen.
    4. Plausibilitätsregeln und Stichproben anwenden.
    5. Fehlerfälle für manuelle Bearbeitung markieren.

    Beispiel

    Aus Lieferdokumenten werden Bestellnummer, Datum, Positionen und Gesamtmenge in eine Tabelle übertragen.

    Qualitätskontrolle

    • Summen, Datumswerte und Pflichtfelder automatisch plausibilisieren.
    • Stichproben mit dem Original vergleichen.
    • Niedrige Konfidenzwerte manuell prüfen.

    Grenzen und Risiken

    • OCR- und Layoutfehler können Werte vertauschen.
    • Personenbezogene und geschäftliche Daten benötigen Schutz und Löschregeln.

    Passende Tools und Modelle

    OCR, Dokumentenmodelle, Tabellenextraktion und Workflow-Systeme.

    Quellen und Leitlinien

  • Präsentationen strukturieren und vorbereiten

    Der größte Nutzen liegt in Struktur, Varianten und Kürzung. Fachliche Aussagen, Diagramme, Quellen und Bildrechte müssen separat geprüft werden.

    Geeignet für

    • Vorträge
    • Schulungen
    • Projektberichte
    • Pitches

    Voraussetzungen

    Zielgruppe, Zeitrahmen, Kernaussage und verlässliches Ausgangsmaterial.

    Vorgehensweise

    1. Kernaussage in einem Satz formulieren.
    2. Publikum und Vortragsdauer angeben.
    3. Eine Dramaturgie mit wenigen Hauptpunkten erzeugen.
    4. Belege, Beispiele und Visualisierungen ergänzen.
    5. Folien reduzieren und den Vortrag testen.

    Beispiel

    Aus einem zehnseitigen Bericht entsteht eine Gliederung für einen zwölfminütigen Vortrag mit sechs Folien.

    Qualitätskontrolle

    • Jede Zahl und Quelle kontrollieren.
    • Pro Folie nur eine Hauptaussage verwenden.
    • Präsentation ohne KI-Unterstützung probeweise vortragen.

    Grenzen und Risiken

    • Automatisch erzeugte Folien können generisch oder inhaltlich überladen sein.
    • Erfundene Quellen und unpassende Bilder müssen ausgeschlossen werden.

    Passende Tools und Modelle

    Sprachmodelle, Präsentationsassistenten und Bildgeneratoren.

    Quellen und Leitlinien

  • Barrierearme Texte und Alternativtexte vorbereiten

    Automatische Vorschläge helfen beim ersten Entwurf. Ob ein Text wirklich verständlich und ein Alternativtext im konkreten Kontext sinnvoll ist, muss durch Menschen geprüft werden.

    Geeignet für

    • Webseiten
    • Dokumente
    • Öffentliche Kommunikation
    • Schulungsmaterial

    Voraussetzungen

    Kenntnis der Zielgruppe, des Nutzungskontexts und der geltenden Barrierefreiheitsanforderungen.

    Vorgehensweise

    1. Zweck des Inhalts und Zielgruppe benennen.
    2. Komplexe Sätze und Fachbegriffe markieren.
    3. Vereinfachte Fassung oder Alternativtext erzeugen.
    4. Bedeutung und Informationsverlust prüfen.
    5. Mit Prüfwerkzeugen und möglichst betroffenen Nutzern testen.

    Beispiel

    Eine komplexe Behördeninformation wird in kürzere Sätze gegliedert; für eine Infografik entsteht ein kontextbezogener Alternativtext.

    Qualitätskontrolle

    • Automatische Lesbarkeit ist kein Nachweis für Barrierefreiheit.
    • Alternativtexte müssen Zweck und Kontext des Bildes berücksichtigen.
    • Kontrast, Tastaturbedienung und Struktur separat testen.

    Grenzen und Risiken

    • Modelle können sichtbare Details falsch beschreiben.
    • Vereinfachung kann wichtige rechtliche oder fachliche Inhalte verändern.

    Passende Tools und Modelle

    Sprachmodelle, Bildanalyse und spezialisierte Barrierefreiheits-Prüfwerkzeuge.

    Quellen und Leitlinien

  • ChatGPT

    ChatGPT ist ein KI-Dienst von OpenAI. Er verbindet dialogbasierte Textarbeit mit multimodalen Funktionen und kann – abhängig von der verfügbaren Produktversion – Dateien, Bilder und Sprache verarbeiten sowie Werkzeuge und agentische Abläufe nutzen.

    Funktionen

    • Fragen beantworten, Inhalte erklären, zusammenfassen und überarbeiten.
    • Dateien und Bilder analysieren sowie strukturierte Ergebnisse erzeugen.
    • Bilder erstellen und bearbeiten; Sprachdialoge und weitere multimodale Funktionen nutzen.
    • Je nach Produktversion recherchieren, Werkzeuge verwenden und mehrstufige Aufgaben bearbeiten.

    Stärken

    • Breites Aufgabenspektrum für Alltag, Lernen, Büro, Kreativität und Entwicklung.
    • Niedrige Einstiegshürde durch natürliche Sprache.
    • Verknüpfung verschiedener Medien und Arbeitsweisen in einer Oberfläche.

    Grenzen

    • Antworten können trotz überzeugender Formulierungen sachlich falsch oder unvollständig sein.
    • Aktuelle Funktionen, Modelle und Nutzungslimits ändern sich regelmäßig.
    • Folgenreiche Entscheidungen erfordern externe Quellen und fachliche Prüfung.

    Datenschutz und Nutzung

    Vertrauliche oder personenbezogene Informationen sollten nur entsprechend den gewählten Kontoeinstellungen, Vertragsbedingungen und internen Datenschutzregeln verarbeitet werden. Für Unternehmen sind die jeweils geltenden Produkt- und Datenkontrollen zu prüfen.

    Preismodell und Verfügbarkeit

    ChatGPT wird in verschiedenen Tarifen angeboten. Modelle, Werkzeuge, Limits und regionale Verfügbarkeit unterscheiden sich. Maßgeblich sind die aktuellen offiziellen Produkt- und Versionshinweise.

    Offizielle Quellen

  • Claude

    Claude ist der dialogbasierte KI-Dienst von Anthropic. Er wird für Schreiben, Analyse, Programmierung, umfangreiche Dokumente und – abhängig von Produkt und Tarif – Werkzeugnutzung sowie agentische Arbeitsabläufe eingesetzt.

    Funktionen

    • Texte analysieren, entwerfen, überarbeiten und strukturieren.
    • Dokumente und umfangreiche Kontexte bearbeiten.
    • Code erklären, erzeugen und in Entwicklungsumgebungen unterstützen.
    • Je nach Produktversion Werkzeuge, Computersteuerung und länger laufende Aufgaben nutzen.

    Stärken

    • Ausführliche Text- und Dokumentarbeit.
    • Starke Ausrichtung auf Analyse, Programmierung und professionelle Arbeitsabläufe.
    • API und Integrationen für eigene Anwendungen.

    Grenzen

    • Auch Claude kann halluzinieren und Quellen falsch einordnen.
    • Funktionsumfang und Modellzugang unterscheiden sich nach Tarif und Plattform.
    • Werkzeug- oder Computeraktionen benötigen Kontrolle und klare Berechtigungsgrenzen.

    Datenschutz und Nutzung

    Vor der Verarbeitung interner Dokumente sind die jeweils geltenden Datenbedingungen, Aufbewahrungseinstellungen und Unternehmensoptionen zu prüfen.

    Preismodell und Verfügbarkeit

    Claude ist als Web- und Mobilanwendung sowie über APIs und ausgewählte Cloud-Plattformen verfügbar. Tarife, Modelle und Limits ändern sich; maßgeblich sind die offiziellen Produktinformationen.

    Offizielle Quellen

  • Gemini

    Gemini ist Googles dialogbasierter KI-Dienst. Er unterstützt Schreiben, Planung, Ideensuche, Recherche und multimodale Aufgaben; einzelne Funktionen sind mit Google-Diensten und spezialisierten Kreativ- oder Forschungswerkzeugen verbunden.

    Funktionen

    • Texte erstellen, erklären, zusammenfassen und planen.
    • Bilder und andere Medien als Eingabe verstehen.
    • Je nach Tarif Deep Research, umfangreiche Kontexte und kreative Medienfunktionen nutzen.
    • Mit ausgewählten Google-Diensten und Arbeitsabläufen zusammenarbeiten.

    Stärken

    • Enge Einbindung in das Google-Ökosystem.
    • Multimodale Modellfamilie und mehrere Leistungs- und Kostenklassen.
    • Zugang über App, Web und Entwickler-API.

    Grenzen

    • Funktionen und Modelle unterscheiden sich nach Region, Tarif und Konto.
    • Rechercheausgaben müssen anhand der Originalquellen geprüft werden.
    • Integrationen können zusätzliche Zugriffsrechte auf persönliche oder geschäftliche Daten benötigen.

    Datenschutz und Nutzung

    Bei der Verbindung mit Google-Diensten ist genau zu prüfen, welche Datenquellen freigegeben werden und welche Kontoeinstellungen gelten.

    Preismodell und Verfügbarkeit

    Gemini ist in kostenlosen und kostenpflichtigen Angeboten verfügbar. Modellzugang, Limits und Zusatzfunktionen werden laufend angepasst.

    Offizielle Quellen

  • Adobe Firefly

    Adobe Firefly ist eine Plattform für generative Kreativarbeit. Sie bietet Funktionen zum Erzeugen und Bearbeiten von Bildern, Video, Audio und Vektorgrafiken und ist mit weiteren Adobe-Anwendungen verbunden.

    Funktionen

    • Bilder aus Text erzeugen und vorhandene Bilder bearbeiten.
    • Objekte entfernen, Hintergründe erweitern und Bilder hochskalieren.
    • Video aus Text oder Bildern erzeugen und bearbeiten.
    • Audio, Sprache, Soundtracks und Vektorgrafiken erzeugen – abhängig vom verfügbaren Funktionsumfang.

    Stärken

    • Breites kreatives Medienangebot in einer Plattform.
    • Integration in Adobe-Arbeitsabläufe.
    • Kontrollierte Bearbeitungsfunktionen zusätzlich zur reinen Generierung.

    Grenzen

    • Generative Ergebnisse benötigen oft mehrere Durchläufe und manuelle Nachbearbeitung.
    • Credits, Modelle und Nutzungsrechte unterscheiden sich nach Tarif und verwendeter Modellquelle.
    • Marken-, Persönlichkeits- und Urheberrechte bleiben unabhängig vom Werkzeug zu beachten.

    Datenschutz und Nutzung

    Vor geschäftlicher Nutzung sind die Bedingungen des jeweiligen Tarifs, die Herkunft des eingesetzten Modells und die Regeln für hochgeladene Inhalte zu prüfen.

    Preismodell und Verfügbarkeit

    Firefly ist mit begrenzten kostenlosen Generierungen sowie in verschiedenen kostenpflichtigen Tarifen verfügbar. Premium-Funktionen werden über Generative Credits gesteuert.

    Offizielle Quellen

  • Runway

    Runway konzentriert sich auf generative Medienproduktion. Die Plattform bietet Modelle und Werkzeuge für Text-zu-Video, Bild-zu-Video, Videobearbeitung, Audio und agentisch erzeugte Mehrfachszenen.

    Funktionen

    • Videos aus Text oder Bildern erzeugen.
    • Bestehende Videos stilistisch oder inhaltlich verändern.
    • Clips verlängern, Bildformate anpassen und Sequenzen kombinieren.
    • Mit einem Kreativ-Agenten mehrteilige Videos planen und zusammensetzen.

    Stärken

    • Spezialisierung auf Bewegtbild und visuelle Kontrolle.
    • Kombination aus Generierung, Bearbeitung und Produktionsablauf.
    • API-Zugang für Bild-, Video- und Audiofunktionen.

    Grenzen

    • Bewegungen, Physik, Identitätskonsistenz und längere Handlungen können weiterhin Fehler zeigen.
    • Hochwertige Ergebnisse benötigen Auswahl, Iteration und Schnitt.
    • Modelle und maximale Längen ändern sich regelmäßig.

    Datenschutz und Nutzung

    Bei realen Personen, Markenmaterial und Kundenproduktionen sind Einwilligungen, Rechte und die jeweils geltenden Plattformbedingungen zu prüfen.

    Preismodell und Verfügbarkeit

    Runway wird in abgestuften Tarifen angeboten; rechenintensive Generierungen verwenden Kontingente oder Credits. Einzelne Modelle können nur in bestimmten Tarifen verfügbar sein.

    Offizielle Quellen

  • GPT-Modellfamilie

    Die GPT-Modellfamilie umfasst generative Modelle von OpenAI für Text, visuelle Eingaben, Programmierung, Reasoning und Werkzeugnutzung. Der konkrete Modellkatalog wird laufend aktualisiert; für technische Entscheidungen ist deshalb die offizielle Modellübersicht maßgeblich.

    Modelltyp und Fähigkeiten

    • Transformer-basierte generative Modelle für Text und weitere Modalitäten.
    • Unterstützung für mehrsprachige Aufgaben, visuelle Eingaben, Code und strukturierte Ausgaben – modellabhängig.
    • Werkzeugaufrufe, agentische Abläufe und unterschiedliche Reasoning-Stufen in aktuellen Modelllinien.

    Technische Einordnung

    GPT-Modelle erzeugen Ausgaben tokenweise auf Grundlage gelernter Wahrscheinlichkeitsverteilungen. Moderne Varianten kombinieren Vortraining, Nachtraining, Sicherheitsverfahren, Werkzeugnutzung und zusätzliche Laufzeitberechnung für komplexe Aufgaben.

    Verfügbarkeit und Zugang

    Der Zugang erfolgt über ChatGPT sowie über OpenAIs API. Modellnamen, Kontextgrößen, Preise und Endpunkte verändern sich; produktive Systeme sollten auf die offizielle Modellliste und Migrationshinweise abgestimmt werden.

    Benchmarks und Grenzen

    Benchmarks zeigen nur Ausschnitte der Leistung. Modelle können halluzinieren, bei ungewöhnlichen Verteilungen versagen und in agentischen Abläufen falsche Aktionen planen. Evaluationen müssen den realen Einsatzzweck, Kosten, Latenz und Sicherheitsanforderungen abbilden.

    Offizielle Quellen

  • Claude-Modellfamilie

    Die Claude-Modellfamilie von Anthropic umfasst Modelle mit unterschiedlichen Profilen für komplexes Reasoning, schnelle Aufgaben, Programmierung und agentische Abläufe. Konkrete Modellvarianten und Grenzwerte werden in der offiziellen Dokumentation gepflegt.

    Modelltyp und Fähigkeiten

    • Große Sprachmodelle für Text, Bilder, Code und Dokumentanalyse.
    • Unterschiedliche Modellklassen für maximale Leistungsfähigkeit, ausgewogene Nutzung und schnelle kosteneffiziente Aufgaben.
    • Werkzeugnutzung, strukturierte Ausgaben und agentische Arbeitsabläufe.

    Technische Einordnung

    Claude-Modelle sind generative Transformer-Systeme. Anthropic kombiniert Vortraining und Nachtraining mit Verfahren zur Steuerbarkeit und Sicherheit. Die Produktfamilie wird regelmäßig durch neue Modellgenerationen ersetzt oder ergänzt.

    Verfügbarkeit und Zugang

    Claude ist über Anthrophics API, die Claude-Anwendungen und ausgewählte Cloud-Plattformen verfügbar. Für stabile Integrationen sind konkrete Modell-IDs und Abschaltfristen zu beachten.

    Benchmarks und Grenzen

    Leistungsangaben sind abhängig von Aufgaben, Prompt, Werkzeugen und Evaluationsmethode. Auch leistungsfähige Varianten können Quellen erfinden, fehlerhafte Schlüsse ziehen oder Werkzeugaktionen falsch ausführen.

    Offizielle Quellen