Medium oder Format: Video

  • Urheberrecht und generative KI: die wichtigsten Fragen

    Es gibt keine einzelne pauschale Antwort auf die Frage, ob KI-Inhalte frei genutzt werden dürfen. Maßgeblich sind unter anderem die verwendeten Vorlagen, die Lizenzbedingungen des Dienstes, mögliche Ähnlichkeiten zu geschützten Werken, Persönlichkeits- und Markenrechte sowie die konkrete Rechtsordnung.

    Vier getrennte Ebenen

    • Dürfen Werke für Training oder Text- und Data-Mining verarbeitet werden?
    • Darf ein Werk oder eine geschützte Figur als Eingabe verwendet werden?
    • Enthält die Ausgabe geschützte Elemente oder unzulässige Ähnlichkeiten?
    • Welche Rechte räumt der Anbieter an der Ausgabe ein?

    Menschlicher Beitrag

    Ob eine Ausgabe selbst urheberrechtlich geschützt ist, hängt in vielen Rechtsordnungen vom menschlichen kreativen Beitrag ab. Eine bloße Maschinenausgabe ist nicht automatisch ein geschütztes Werk.

    Praktische Vorsicht

    • Keine vertrauten Logos, Figuren oder Künstlerstile als pauschale Freigabe behandeln
    • Bei kommerzieller Nutzung Anbieterbedingungen und Herkunft der Bestandteile prüfen
    • Entstehungsprozess, Eingaben und Bearbeitungsschritte dokumentieren
    • Bei erheblichen wirtschaftlichen Risiken fachkundige Rechtsprüfung einholen

    Keine Rechtsberatung

    Der Artikel erklärt Fragestellungen und ersetzt keine Prüfung eines konkreten Werkes oder Nutzungsfalls.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • Content Credentials und C2PA: Herkunft statt KI-Detektor

    C2PA verfolgt einen Herkunftsansatz: Ein Manifest kann dokumentieren, welches Gerät oder Programm einen Inhalt erzeugt oder verändert hat. Das beweist nicht, dass eine Aussage wahr ist, schafft aber überprüfbare Informationen über die Bearbeitungskette.

    Was gespeichert werden kann

    • Herkunft eines Bildes, Videos, Audios oder Dokuments
    • Verwendete Anwendungen und Bearbeitungsschritte
    • Zeitpunkte und kryptografische Bindungen an den Inhalt
    • Hinweise auf generative oder manipulative Verarbeitung

    Was es nicht beweist

    • Dass die dargestellte Szene tatsächlich stattgefunden hat
    • Dass alle früheren Bearbeitungsschritte vollständig dokumentiert wurden
    • Dass ein Inhalt ohne Credentials automatisch falsch ist
    • Dass Metadaten niemals entfernt oder durch Plattformen verloren gehen

    Vorteil gegenüber Detektoren

    Ein Detektor versucht aus dem fertigen Inhalt zu raten, ob KI beteiligt war. Provenienzsysteme dokumentieren dagegen den Entstehungs- und Bearbeitungsweg, sofern beteiligte Werkzeuge sie unterstützen.

    Praxis

    Bei eigener Medienproduktion Credentials möglichst erhalten, sichtbare Kennzeichnungen ergänzen und die Originaldateien sicher archivieren.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • Deepfakes erkennen: Warum Augenmaß wichtiger ist als ein Detektor

    Generative Systeme können Bild, Audio und Video sehr überzeugend verändern. Gleichzeitig erzeugen Kompression, Schnitt, schlechte Verbindung und normale Bearbeitung ähnliche Artefakte. Eine belastbare Prüfung kombiniert Quelle, Kontext, Herkunftsdaten und unabhängige Bestätigung.

    Prüfung in fünf Schritten

    1. Originalquelle und früheste Veröffentlichung suchen
    2. Datum, Ort und behaupteten Kontext prüfen
    3. Mit unabhängigen seriösen Quellen vergleichen
    4. Nach Schnitten, unpassenden Reflexionen oder Tonübergängen suchen, ohne einzelne Artefakte zu überbewerten
    5. Vorhandene Content Credentials oder Originaldateien prüfen

    Detektoren richtig einordnen

    Detektoren liefern Wahrscheinlichkeiten und können durch neue Generatoren, Bearbeitung oder Kompression versagen. Ihr Ergebnis ist ein Hinweis, kein Beweis.

    Bei Stimmen

    Eine vertraut klingende Stimme ist kein Identitätsnachweis. Bei Geldforderungen oder dringenden Anweisungen immer über einen zweiten, bekannten Kommunikationsweg rückfragen.

    Bei akuter Gefahr

    Betrugsversuche dokumentieren, nicht weiterverbreiten und bei Bedarf Plattform, Bank oder zuständige Behörden kontaktieren.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • Desinformation mit KI: Geschwindigkeit, Umfang und Glaubwürdigkeit

    Das Risiko entsteht aus der Kombination von massenhafter Produktion, gezielter Ansprache, glaubwürdig wirkenden Medien und schneller Verbreitung. Gegenmaßnahmen müssen daher nicht nur einzelne Fälschungen erkennen, sondern auch Quellen, Verteilung und Anreize betrachten.

    Typische Muster

    • Erfundene Zitate und Dokumente
    • Imitierte Stimmen für Betrug oder Rufschädigung
    • Bilder realer Ereignisse in falschem Kontext
    • Viele leicht veränderte Beiträge zur künstlichen Verstärkung
    • Automatisierte Konten und personalisierte Nachrichten

    Robuste Gegenmaßnahmen

    • Verifizierte Kommunikationskanäle für offizielle Aussagen
    • Vier-Augen-Prinzip bei finanziellen oder sicherheitskritischen Anweisungen
    • Schnelle öffentliche Korrekturen mit Belegen
    • Archivierung von Originalmaterial und Herkunftsinformationen
    • Medienkompetenz statt Vertrauen in einen einzigen Detektor

    Nicht vorschnell als KI bezeichnen

    Auch echte Inhalte können ungewöhnlich aussehen. Eine falsche Deepfake-Behauptung kann selbst zur Desinformation werden.

    Quellen und Rechtsstand

    Prüfstand: 28.07.2026. Rechtliche Beiträge dienen der allgemeinen Information und ersetzen keine Rechtsberatung.

  • World Models: gelernte Modelle einer Umgebung

    World Models lernen nicht die gesamte Wirklichkeit. Sie bilden diejenigen Zusammenhänge ab, die in den Trainingsdaten und für eine bestimmte Aufgabe sichtbar sind. Ein Agent kann solche Modelle nutzen, um mögliche Folgen von Handlungen zu simulieren, bevor er handelt.

    Einfach erklärt

    Ein World Model ist eine gelernte Simulation. Es versucht vorherzusagen, wie eine Szene oder ein System nach einer Aktion aussehen könnte.

    Grundidee

    • Beobachtungen werden in eine kompakte Repräsentation übersetzt
    • Ein Dynamikmodell sagt den nächsten Zustand voraus
    • Ein Agent bewertet mögliche Handlungen in dieser internen Simulation
    • Die gewählte Handlung wird in der realen oder virtuellen Umgebung ausgeführt

    Einsatzfelder

    • Robotik und autonome Systeme
    • Spiele und interaktive Umgebungen
    • Planung von Handlungsfolgen
    • Simulation physikalischer oder visueller Prozesse

    Grenzen

    • Unbekannte Situationen werden möglicherweise falsch simuliert
    • Seltene Ereignisse fehlen oft in den Daten
    • Visuell plausible Vorhersagen können physikalisch falsch sein
    • Fehler wachsen bei langen Simulationen schrittweise an

    Expertenwissen

    Frühe World-Model-Architekturen kombinierten einen visuellen Autoencoder, ein rekurrentes Dynamikmodell und einen kompakten Controller. Neuere Ansätze verwenden Transformer und generative Modelle, um hochdimensionale Umgebungen und interaktive Szenen abzubilden.

    Primärquellen

  • Audio transkribieren und Untertitel erstellen

    Gute Audioqualität verbessert das Ergebnis. Eigennamen, Fachbegriffe, Sprecherwechsel und Zeitmarken benötigen häufig manuelle Nacharbeit.

    Geeignet für

    • Videos
    • Podcasts
    • Interviews
    • Barrierefreie Medien

    Voraussetzungen

    Rechtmäßig nutzbares Audiomaterial, passende Spracheinstellung und ein klarer Umgang mit personenbezogenen Daten.

    Vorgehensweise

    1. Audioqualität prüfen und Störgeräusche reduzieren.
    2. Transkription mit Sprache und gegebenenfalls Sprechererkennung erstellen.
    3. Text korrigieren und sinnvoll segmentieren.
    4. Zeitmarken und Lesegeschwindigkeit prüfen.
    5. Untertitel im Zielmedium testen.

    Beispiel

    Ein Interview wird transkribiert und als korrigierte Untertiteldatei für ein Video ausgegeben.

    Qualitätskontrolle

    • Namen, Zahlen und Fachbegriffe mit dem Original abgleichen.
    • Untertitel auf Bildschirmzeit und Zeilenlänge prüfen.
    • Sensible Rohaufnahmen geschützt speichern.

    Grenzen und Risiken

    • Überlappende Sprecher und schlechte Aufnahmen verringern die Genauigkeit.
    • Automatische Sprecherzuordnung ist nicht immer zuverlässig.

    Passende Tools und Modelle

    Speech-to-Text-Modelle, Untertitel-Editoren und Videobearbeitungssysteme.

    Quellen und Leitlinien

  • Videos und Szenen mit KI vorbereiten

    Die Technik ist stark für Konzept, Previsualisierung und kurze Szenen. Konsistenz, Physik, Personen, Rechte und mögliche Täuschung müssen sorgfältig geprüft werden.

    Geeignet für

    • Storyboards
    • Werbung
    • Erklärvideos
    • Filmprototypen

    Voraussetzungen

    Ein klares Szenenkonzept, rechtmäßig nutzbare Referenzen und ein Plan für Schnitt und Ton.

    Vorgehensweise

    1. Ziel, Dauer und Bildformat festlegen.
    2. Szene in einzelne Einstellungen zerlegen.
    3. Referenzbilder und Bewegungsbeschreibung vorbereiten.
    4. Kurze Varianten erzeugen und auswählen.
    5. Schnitt, Ton, Kennzeichnung und Fakten prüfen.

    Beispiel

    Aus einer Produktillustration entsteht eine kurze Kamerafahrt als Entwurf für einen Werbeclip.

    Qualitätskontrolle

    • Gesichter, Hände, Logos, Bewegungen und Kontinuität prüfen.
    • Reale Personen und Ereignisse nicht täuschend darstellen.
    • Nutzungsrechte für Referenzmaterial und Ausgabe klären.

    Grenzen und Risiken

    • Längere Szenen können visuell inkonsistent werden.
    • Realistische Ausgaben können als echte Aufnahmen missverstanden werden.

    Passende Tools und Modelle

    Video- und Bild-zu-Video-Generatoren, Schnittprogramme und Audiowerkzeuge.

    Quellen und Leitlinien

  • Social-Media-Inhalte planen und variieren

    Die Technik spart Zeit bei Varianten und Struktur. Marke, Fakten, Zielgruppe, Rechte und Plattformregeln bleiben redaktionelle Verantwortung.

    Geeignet für

    • Redaktionsplanung
    • Kampagnen
    • Vereine und kleine Betriebe

    Voraussetzungen

    Kommunikationsziel, Zielgruppe, Markenstil und freigegebene Fakten.

    Vorgehensweise

    1. Ziele und Themenzeitraum festlegen.
    2. Formate und Plattformen auswählen.
    3. Entwürfe und Varianten erzeugen.
    4. Fakten, Ton, Bildrechte und Barrierefreiheit prüfen.
    5. Beiträge zeitlich planen und Reaktionen auswerten.

    Beispiel

    Aus einer Veranstaltungsbeschreibung entstehen Varianten für Website, Kurzbeitrag und Bildunterschrift.

    Qualitätskontrolle

    • Keine ungeprüften Behauptungen veröffentlichen.
    • Markenstimme und rechtliche Pflichtangaben kontrollieren.
    • Synthetische Medien bei Bedarf kennzeichnen.

    Grenzen und Risiken

    • Automatische Texte können austauschbar oder unpassend wirken.
    • Plattformregeln und gesellschaftlicher Kontext ändern sich.

    Passende Tools und Modelle

    Sprachmodelle, Bildgeneratoren und Redaktionsplanungswerkzeuge.

    Quellen und Leitlinien

  • Gemini-Modellfamilie

    Gemini bezeichnet Googles Familie multimodaler Modelle. Verschiedene Varianten sind auf hohe Leistungsfähigkeit, Geschwindigkeit, geringe Kosten, Echtzeit-Audio oder spezielle Aufgaben ausgerichtet.

    Modelltyp und Fähigkeiten

    • Multimodale Verarbeitung von Text, Bildern, Audio, Video und Code – abhängig vom Modell.
    • Unterschiedliche Pro-, Flash- und spezialisierte Varianten.
    • Werkzeugnutzung, lange Kontexte und Echtzeitanwendungen in ausgewählten Modellen.

    Technische Einordnung

    Gemini-Modelle werden als multimodale Foundation Models entwickelt. Die Modellfamilie umfasst verschiedene Größen und Laufzeitprofile; experimentelle Endpunkte können sich schneller ändern als stabile Varianten.

    Verfügbarkeit und Zugang

    Zugang besteht über die Gemini-Anwendungen, Google AI Studio, die Gemini API und Google-Cloud-Angebote. Für produktive Systeme sollten stabile Modellkennungen und offizielle Lebenszyklusangaben verwendet werden.

    Benchmarks und Grenzen

    Vergleiche zwischen Modellvarianten sind nur bei identischen Aufgaben und Einstellungen aussagekräftig. Multimodalität beseitigt weder Halluzinationen noch Fehler bei Bildern, langen Kontexten oder Werkzeugaktionen.

    Offizielle Quellen

  • Veo 3.1

    Veo 3.1 ist ein Videogenerierungsmodell von Google DeepMind. Es erzeugt Videos aus Text oder Bildern und kann Bild, Umgebungsgeräusche, Effekte und Dialog gemeinsam generieren.

    Modelltyp und Fähigkeiten

    • Text-zu-Video und Bild-zu-Video.
    • Native Erzeugung von Ton, Geräuschen und Dialog zusammen mit dem Video.
    • Steuerung von Stil, Kameraführung, Bewegung und visueller Kontinuität.
    • Kennzeichnung generierter Inhalte mit Googles SynthID-Technologie.

    Technische Einordnung

    Veo gehört zu generativen Videomodellen, die räumliche und zeitliche Bildfolgen modellieren. Die Audio-Video-Generierung erweitert die Aufgabe um zeitlich passende akustische Signale.

    Verfügbarkeit und Zugang

    Veo ist über ausgewählte Google-Produkte und Entwicklerzugänge verfügbar. Zugang, Auflösung, Länge, Limits und regionale Verfügbarkeit hängen vom Produkt und Tarif ab.

    Benchmarks und Grenzen

    Herstellervergleiche und Präferenztests bilden nicht alle realen Produktionsbedingungen ab. Physik, Text im Bild, längere Handlungslogik, wiederkehrende Personen und präzise Schnittkontrolle können weiterhin Fehler zeigen.

    Offizielle Quellen