Trainingsdaten

Fortgeschritten

Woher Trainingsbeispiele kommen, wie sie verarbeitet werden und was eine brauchbare Datensatzbeschreibung offenlegt.

Zuletzt aktualisiert: 13. Sept. 2026

Quellen mit prüfbarer Herkunft

Ausgewählte Beispiele, geprüft am 13.09.2026. Größen gehören zum jeweils benannten Stand. Bytes, Dokumente und Tokens sind unterschiedliche Maße; Tokenzahlen hängen vom Encoding ab.

Common Crawl

Common Crawl Foundation · Web

Crawl-ID / snapshot

Ein Archiv von Web-Crawls. Crawl-ID und Filter bestimmen die tatsächlichen Trainingsdaten. Der Archivzugang belegt keine einheitliche Lizenz für alle enthaltenen Seiten.

Originalquelle / Datenkarte

The Pile

EleutherAI · Gemischt

2020 paper · 825 GiB · 22 subsets

Eine historische englische Mischung aus 22 Komponenten. Herkunft und Rechte pro Komponente prüfen; die ursprüngliche Mischung enthält Books3. Ein Gesamtlabel wie legitim verdeckt diese Unterschiede.

Originalquelle / Datenkarte

FineWeb

Hugging Face · Web

2024 release · 15T tokens

Gefilterter englischer Text aus Common Crawl. Die genannte Veröffentlichung ist ein historischer Stand, keine aktuelle Gesamtgröße. Die Datenkarte dokumentiert Verarbeitung und ODC-By-Bedingungen; Rechte der Quellinhalte sind gesondert zu betrachten.

Originalquelle / Datenkarte

The Stack v2

BigCode · Code

v2 · 67.5 TB (full corpus)

Code aus Software Heritage. Vollkorpus, deduplizierter Korpus und Trainings-Teilmengen haben unterschiedliche Größen. Datensatzbedingungen und ursprüngliche Repository-Lizenzen beachten; wegen Opt-outs eine Revision festhalten.

Originalquelle / Datenkarte

Cosmopedia

Hugging Face · Synthetisch

v0.1 · 2024

Mit Mixtral erzeugte synthetische Lehrtexte. Generator, Prompts, Ausgangsquellen und Validierung dokumentieren. Synthetisch beschreibt die Herstellung, nicht Qualität oder Rechtsstatus.

Originalquelle / Datenkarte

Qualität entsteht in der Verarbeitung

Deduplizierung, Sprachabdeckung, Filter und Sampling verändern, was ein Modell lernt. Einen getrennten Evaluationssatz halten, Überschneidungen mit Trainingsdaten prüfen und die Zielaufgaben messen. Ein größerer Korpus ist nicht automatisch besser. Strenge Filter können auch nützliche Dialekte, Sprachen oder Minderheitenperspektiven entfernen.

Synthetische Daten brauchen eine Herkunft

Modellerzeugte Daten können Instruktions-, Code- und Reasoning-Beispiele ergänzen. Generatorversion, Prompts, Ausgangsmaterial und Auswahlkriterien festhalten. Antworten möglichst mit aufgabenspezifischen Prüfungen validieren; Vielfalt und Kontamination evaluieren. Wiederholtes Training auf ungeprüften Modellausgaben kann Fehler verstärken oder Abdeckung verlieren. Das Ergebnis hängt von Auswahl, frischen Daten und Trainingsaufbau ab.

Zugang, Lizenzen und personenbezogene Daten getrennt erfassen

Öffentlich, offen, lizenziert und rechtmäßig sind keine austauschbaren Labels. Ein Datensatz kann Komponenten mit unterschiedlichen Bedingungen enthalten. Beschaffung, ursprüngliche Lizenzen, Opt-outs und Umgang mit personenbezogenen Daten dokumentieren. Eine Klage oder Behauptung braucht Quelle und Verfahrensstand; sie ist kein abschließendes Urteil über jede Trainingsnutzung.

Dokumentation allgemeiner KI-Modelle in der EU

Der AI Act enthält Pflichten für Anbieter von KI-Modellen mit allgemeinem Verwendungszweck (GPAI), darunter technische Dokumentation, eine Strategie zur Einhaltung des Urheberrechts und eine hinreichend detaillierte öffentliche Zusammenfassung der Trainingsinhalte. Anwendungsbereich, Ausnahmen und Übergangsregeln hängen von Anbieter und Modell ab. Die Pflichten betreffen nicht nur nachgelagerte Hochrisikosysteme. Maßgeblich für die aktuelle Einordnung sind die Leitlinien der Kommission.

Europäische Kommission: Leitlinien für GPAI-Anbieter

Was ein Datensatzvergleich festhalten sollte

  • Herausgeber und genaue Veröffentlichung oder Revision
  • Quelldomains, Beschaffung und Verarbeitungsschritte
  • Größe, Einheit, Tokenizer und Filterstufe
  • Lizenzbedingungen und bekannte Herkunftslücken
  • Aufteilung, Benchmark-Überschneidung und Evaluationsergebnisse