Wissensstufe: Einfach

  • Runway

    Runway konzentriert sich auf generative Medienproduktion. Die Plattform bietet Modelle und Werkzeuge für Text-zu-Video, Bild-zu-Video, Videobearbeitung, Audio und agentisch erzeugte Mehrfachszenen.

    Funktionen

    • Videos aus Text oder Bildern erzeugen.
    • Bestehende Videos stilistisch oder inhaltlich verändern.
    • Clips verlängern, Bildformate anpassen und Sequenzen kombinieren.
    • Mit einem Kreativ-Agenten mehrteilige Videos planen und zusammensetzen.

    Stärken

    • Spezialisierung auf Bewegtbild und visuelle Kontrolle.
    • Kombination aus Generierung, Bearbeitung und Produktionsablauf.
    • API-Zugang für Bild-, Video- und Audiofunktionen.

    Grenzen

    • Bewegungen, Physik, Identitätskonsistenz und längere Handlungen können weiterhin Fehler zeigen.
    • Hochwertige Ergebnisse benötigen Auswahl, Iteration und Schnitt.
    • Modelle und maximale Längen ändern sich regelmäßig.

    Datenschutz und Nutzung

    Bei realen Personen, Markenmaterial und Kundenproduktionen sind Einwilligungen, Rechte und die jeweils geltenden Plattformbedingungen zu prüfen.

    Preismodell und Verfügbarkeit

    Runway wird in abgestuften Tarifen angeboten; rechenintensive Generierungen verwenden Kontingente oder Credits. Einzelne Modelle können nur in bestimmten Tarifen verfügbar sein.

    Offizielle Quellen

  • Suno

    Suno ist eine Plattform zur KI-gestützten Musikproduktion. Nutzer können aus einer Beschreibung oder eigenen Texten vollständige Musikstücke erzeugen und – je nach Produktversion – Songs bearbeiten, remixen, covern oder mit eigenen Audioideen weiterentwickeln.

    Funktionen

    • Musik und vollständige Songs aus Textbeschreibungen erzeugen.
    • Eigene Liedtexte, Stile und musikalische Vorgaben verwenden.
    • Bestehende Ideen über Cover-, Remix-, Sample- und Studiofunktionen weiterbearbeiten.
    • Je nach Funktion Stimmen oder eigene musikalische Präferenzen einbinden.

    Stärken

    • Sehr niedrige Einstiegshürde für vollständige Musikstücke.
    • Schnelle Erprobung verschiedener Genres, Arrangements und Textideen.
    • Zusätzliche Bearbeitungswerkzeuge über die reine Ein-Klick-Generierung hinaus.

    Grenzen

    • Musikalische Struktur, Aussprache und längere Konsistenz können schwanken.
    • Ähnlichkeiten zu bestehenden Werken oder Stimmen müssen kritisch geprüft werden.
    • Nutzungs- und Verwertungsrechte hängen vom Tarif und den aktuellen Bedingungen ab.

    Datenschutz und Nutzung

    Bei eigenen Stimmaufnahmen oder fremdem Audiomaterial sind Einwilligungen und Rechte zu beachten. Für Veröffentlichungen gelten zusätzlich die Bedingungen von Plattformen und Verwertungsgesellschaften.

    Preismodell und Verfügbarkeit

    Suno bietet kostenlose und kostenpflichtige Nutzung. Export, kommerzielle Rechte, Kontingente und Studiofunktionen unterscheiden sich nach Tarif.

    Offizielle Quellen

  • ElevenLabs

    ElevenLabs ist auf synthetische Sprache und Voice-AI spezialisiert. Die Plattform erzeugt Sprache aus Text, verändert vorhandene Stimmen, unterstützt mehrsprachige Produktionen und bietet Sprachagenten für dialogbasierte Anwendungen.

    Funktionen

    • Text in natürlich klingende Sprache umwandeln.
    • Vorhandene Sprachaufnahmen verändern oder in andere Sprachen übertragen.
    • Voiceover, Hörinhalte und mehrsprachige Synchronisation erstellen.
    • Sprachagenten für interaktive Dialoge und Kundenprozesse aufbauen.

    Stärken

    • Spezialisierung auf Ausdruck, Stimmen und mehrsprachige Audioproduktion.
    • Anwendungen für kreative Inhalte und dialogbasierte Systeme.
    • Webanwendung, mobile Funktionen und Entwickler-APIs.

    Grenzen

    • Aussprache, Eigennamen, Emotionen und lange Aufnahmen benötigen Kontrolle.
    • Stimmenklonen birgt erhebliche Missbrauchs- und Einwilligungsrisiken.
    • Tarife, Sprachumfang und Modellzugang ändern sich.

    Datenschutz und Nutzung

    Stimmen realer Personen dürfen nur mit klarer Berechtigung und dokumentierter Einwilligung verwendet werden. Täuschende oder nicht gekennzeichnete Imitationen können rechtlich und ethisch problematisch sein.

    Preismodell und Verfügbarkeit

    ElevenLabs bietet unterschiedliche Tarife und verbrauchsabhängige Kontingente. Produktbereiche für Kreativinhalte und Sprachagenten können getrennte Bedingungen besitzen.

    Offizielle Quellen

  • ChatGPT

    ChatGPT ist ein KI-Dienst von OpenAI. Er verbindet dialogbasierte Textarbeit mit multimodalen Funktionen und kann – abhängig von der verfügbaren Produktversion – Dateien, Bilder und Sprache verarbeiten sowie Werkzeuge und agentische Abläufe nutzen.

    Funktionen

    • Fragen beantworten, Inhalte erklären, zusammenfassen und überarbeiten.
    • Dateien und Bilder analysieren sowie strukturierte Ergebnisse erzeugen.
    • Bilder erstellen und bearbeiten; Sprachdialoge und weitere multimodale Funktionen nutzen.
    • Je nach Produktversion recherchieren, Werkzeuge verwenden und mehrstufige Aufgaben bearbeiten.

    Stärken

    • Breites Aufgabenspektrum für Alltag, Lernen, Büro, Kreativität und Entwicklung.
    • Niedrige Einstiegshürde durch natürliche Sprache.
    • Verknüpfung verschiedener Medien und Arbeitsweisen in einer Oberfläche.

    Grenzen

    • Antworten können trotz überzeugender Formulierungen sachlich falsch oder unvollständig sein.
    • Aktuelle Funktionen, Modelle und Nutzungslimits ändern sich regelmäßig.
    • Folgenreiche Entscheidungen erfordern externe Quellen und fachliche Prüfung.

    Datenschutz und Nutzung

    Vertrauliche oder personenbezogene Informationen sollten nur entsprechend den gewählten Kontoeinstellungen, Vertragsbedingungen und internen Datenschutzregeln verarbeitet werden. Für Unternehmen sind die jeweils geltenden Produkt- und Datenkontrollen zu prüfen.

    Preismodell und Verfügbarkeit

    ChatGPT wird in verschiedenen Tarifen angeboten. Modelle, Werkzeuge, Limits und regionale Verfügbarkeit unterscheiden sich. Maßgeblich sind die aktuellen offiziellen Produkt- und Versionshinweise.

    Offizielle Quellen

  • Claude

    Claude ist der dialogbasierte KI-Dienst von Anthropic. Er wird für Schreiben, Analyse, Programmierung, umfangreiche Dokumente und – abhängig von Produkt und Tarif – Werkzeugnutzung sowie agentische Arbeitsabläufe eingesetzt.

    Funktionen

    • Texte analysieren, entwerfen, überarbeiten und strukturieren.
    • Dokumente und umfangreiche Kontexte bearbeiten.
    • Code erklären, erzeugen und in Entwicklungsumgebungen unterstützen.
    • Je nach Produktversion Werkzeuge, Computersteuerung und länger laufende Aufgaben nutzen.

    Stärken

    • Ausführliche Text- und Dokumentarbeit.
    • Starke Ausrichtung auf Analyse, Programmierung und professionelle Arbeitsabläufe.
    • API und Integrationen für eigene Anwendungen.

    Grenzen

    • Auch Claude kann halluzinieren und Quellen falsch einordnen.
    • Funktionsumfang und Modellzugang unterscheiden sich nach Tarif und Plattform.
    • Werkzeug- oder Computeraktionen benötigen Kontrolle und klare Berechtigungsgrenzen.

    Datenschutz und Nutzung

    Vor der Verarbeitung interner Dokumente sind die jeweils geltenden Datenbedingungen, Aufbewahrungseinstellungen und Unternehmensoptionen zu prüfen.

    Preismodell und Verfügbarkeit

    Claude ist als Web- und Mobilanwendung sowie über APIs und ausgewählte Cloud-Plattformen verfügbar. Tarife, Modelle und Limits ändern sich; maßgeblich sind die offiziellen Produktinformationen.

    Offizielle Quellen

  • Große Sprachmodelle (LLMs)

    Ein Large Language Model erzeugt Sprache, indem es aus dem bisherigen Kontext Wahrscheinlichkeiten für die nächsten Token berechnet. Seine flüssige Sprache ist kein Beweis für gesichertes Wissen oder menschliches Verständnis.

    Einfach erklärt

    Ein Sprachmodell erhält einen Text und berechnet, welche Textteile wahrscheinlich folgen. Dieser Vorgang wird wiederholt, bis eine Antwort entstanden ist.

    Durch sehr umfangreiches Training kann das Modell Grammatik, Stil, Faktenmuster und viele Aufgabenformen abbilden. Es besitzt aber kein eingebautes Wahrheitsprüfsystem. Es kann überzeugend formulieren und trotzdem falsch liegen.

    Anschauliches Beispiel

    Nach dem Satz „Die Hauptstadt von Frankreich ist“ erhält das Token „Paris“ eine sehr hohe Wahrscheinlichkeit. Bei offenen Fragen gibt es viele mögliche Fortsetzungen. Das Modell wählt abhängig von seinen Einstellungen eine davon aus.

    Fortgeschrittene Erklärung

    LLMs sind meist Transformer-basierte Foundation Models. Sie werden zunächst auf großen Text- und Codedatensätzen vortrainiert. Danach können weitere Trainingsschritte folgen, etwa Instruction Tuning oder Präferenzoptimierung, damit das Modell Anweisungen besser befolgt.

    Der Kontext umfasst die aktuelle Eingabe und gegebenenfalls vorherige Nachrichten oder eingefügte Dokumente. Informationen außerhalb des Kontextes stammen aus den gelernten Parametern oder aus angebundenen Werkzeugen wie Suche und Retrieval.

    Expertenwissen

    Autoregressive LLMs modellieren eine Sequenzwahrscheinlichkeit als Produkt bedingter Wahrscheinlichkeiten. Die Transformer-Architektur berechnet kontextabhängige Repräsentationen mit Attention. Beim Training wird häufig die Vorhersage verdeckter oder nächster Token optimiert.

    Skalierung verbessert viele Fähigkeiten, beseitigt aber grundlegende Probleme nicht automatisch. Kalibrierung, Datenherkunft, Evaluierung, Systemprompt, Sampling und externe Werkzeuge beeinflussen Zuverlässigkeit und Verhalten.

    Möglichkeiten und Grenzen

    • Texterzeugung, Zusammenfassung, Übersetzung, Klassifikation, Code und dialogische Unterstützung.
    • Kann mit Dokumenten, Suchsystemen und Programmierschnittstellen verbunden werden.
    • Kennt nicht automatisch den aktuellen Stand und kann Quellen erfinden.
    • Kann Anweisungen missverstehen oder widersprüchliche Ziele verfolgen.
    • Vertrauliche und kritische Inhalte erfordern kontrollierte Prozesse.

    Quellen

  • Embedding

    Eine numerische Vektorrepräsentation von Text, Bildern oder anderen Daten, in der ähnliche Inhalte häufig nahe beieinander liegen.

    Einfach erklärt

    Eine numerische Vektorrepräsentation von Text, Bildern oder anderen Daten, in der ähnliche Inhalte häufig nahe beieinander liegen.

    Beispiel

    Eine semantische Suche kann „Passwort zurücksetzen“ finden, obwohl nach „Zugangsdaten ändern“ gesucht wurde.

    Technische Bedeutung

    Embeddings werden durch trainierte Modelle erzeugt und mit Distanz- oder Ähnlichkeitsmaßen verglichen.

    Verwandte Begriffe

    Vektorsuche, RAG, Token

    Quellen

  • Transformer und Attention

    Ein Transformer bewertet, welche Teile einer Eingabe für andere Teile besonders wichtig sind. Dieser Attention-Mechanismus ermöglicht kontextabhängige Repräsentationen und eine stark parallelisierbare Verarbeitung.

    Einfach erklärt

    In einem Satz hängt die Bedeutung eines Wortes von anderen Wörtern ab. Attention berechnet, auf welche Stellen das Modell bei der Verarbeitung besonders achten sollte.

    Bei „Die Bank am Fluss“ und „die Bank überweist Geld“ erhält das Wort „Bank“ durch den umgebenden Kontext unterschiedliche Repräsentationen.

    Anschauliches Beispiel

    Bei der Übersetzung eines langen Satzes kann ein Transformer für jedes Wort Beziehungen zu allen relevanten Wörtern berechnen. Dadurch muss Information nicht nur Schritt für Schritt durch eine lange Kette weitergereicht werden.

    Fortgeschrittene Erklärung

    Self-Attention erzeugt aus Eingaberepräsentationen Query-, Key- und Value-Vektoren. Ähnlichkeiten zwischen Queries und Keys bestimmen Gewichte, mit denen Values kombiniert werden. Multi-Head Attention berechnet mehrere solcher Beziehungsmuster parallel.

    Positionsinformationen müssen zusätzlich eingebracht werden, weil reine Attention keine natürliche Reihenfolge kennt. Feedforward-Schichten, Residualverbindungen und Normalisierung ergänzen die Architektur.

    Expertenwissen

    Die skalierte Dot-Product-Attention berechnet softmax(QKᵀ/√d)V. Die quadratische Abhängigkeit von der Sequenzlänge ist bei langen Kontexten ein wesentlicher Ressourcenfaktor. Zahlreiche spätere Varianten optimieren Speicher, Rechenaufwand, Positionskodierung und den Umgang mit langen Sequenzen.

    Der ursprüngliche Transformer wurde für maschinelle Übersetzung vorgestellt. Seine Architektur wurde anschließend auf Sprachmodelle, Vision, Audio, Biologie, Robotik und multimodale Systeme übertragen.

    Möglichkeiten und Grenzen

    • Effiziente parallele Verarbeitung während des Trainings.
    • Gute Modellierung weiter Abhängigkeiten in Sequenzen.
    • Hoher Speicher- und Rechenbedarf bei langen Kontexten.
    • Attention-Gewichte sind nicht automatisch eine vollständige Erklärung einer Modellentscheidung.

    Quellen

  • Fine-Tuning

    Zusätzliches Training eines bereits vortrainierten Modells für eine bestimmte Aufgabe, Domäne oder Verhaltensweise.

    Einfach erklärt

    Zusätzliches Training eines bereits vortrainierten Modells für eine bestimmte Aufgabe, Domäne oder Verhaltensweise.

    Beispiel

    Ein allgemeines Sprachmodell wird mit geprüften Fachbeispielen weitertrainiert, damit es eine bestimmte Textsorte besser beherrscht.

    Technische Bedeutung

    Beim Fine-Tuning werden Modellparameter mit einem kleineren, zielgerichteten Datensatz weiter optimiert. Alternativen sind Prompting, RAG und Adapterverfahren.

    Verwandte Begriffe

    Training, Foundation Model, RAG

    Quellen

  • Token, Kontextfenster und Wahrscheinlichkeiten

    Ein Sprachmodell liest keine Wörter wie ein Mensch. Es zerlegt Text in Token und berechnet für mögliche Fortsetzungen Wahrscheinlichkeiten. Das Kontextfenster bestimmt, welche Token gleichzeitig berücksichtigt werden.

    Einfach erklärt

    Token können ganze Wörter, Wortteile, Satzzeichen oder Zeichenfolgen sein. Häufige Wörter bestehen oft aus wenigen Token, seltene Wörter aus mehreren.

    Das Kontextfenster ist der begrenzte Arbeitsbereich des Modells. Enthält ein Gespräch mehr Token als verarbeitet werden können, müssen ältere Teile gekürzt, zusammengefasst oder anderweitig gespeichert werden.

    Anschauliches Beispiel

    Das deutsche Kompositum „Datenschutzfolgenabschätzung“ kann in mehrere Token zerlegt werden. Für das Modell ist deshalb die Anzahl der Wörter nicht identisch mit der Anzahl der verarbeiteten Einheiten.

    Fortgeschrittene Erklärung

    Tokenizer ordnen Textstücken numerische IDs zu. Das Modell wandelt diese IDs in Vektorrepräsentationen um. Für die nächste Position entsteht eine Wahrscheinlichkeitsverteilung über das Vokabular.

    Sampling-Parameter beeinflussen, wie vorhersehbar oder vielfältig eine Ausgabe wird. Eine niedrigere Zufälligkeit kann Antworten konsistenter machen, garantiert aber keine sachliche Richtigkeit.

    Expertenwissen

    Tokenisierung ist ein Kompromiss zwischen Vokabulargröße und Sequenzlänge. Verfahren wie Byte Pair Encoding oder verwandte Subword-Methoden können unbekannte Wörter aus kleineren Einheiten zusammensetzen.

    Die nutzbare Kontextlänge ist nicht mit einem perfekten Langzeitgedächtnis gleichzusetzen. Auch innerhalb des technischen Limits können relevante Informationen übersehen, schwächer gewichtet oder durch konkurrierenden Kontext verdrängt werden.

    Möglichkeiten und Grenzen

    • Lange Kontexte ermöglichen die Analyse umfangreicher Dokumente und Dialoge.
    • Mehr Kontext erhöht Kosten und kann neue Ablenkungen erzeugen.
    • Tokenlimits unterscheiden sich je nach Modell und Produkt.
    • Ein großer Kontext ersetzt keine strukturierte Dokumentensuche oder Qualitätskontrolle.

    Quellen