Quellen mit prüfbarer Herkunft
Ausgewählte Beispiele, geprüft am 13.09.2026. Größen gehören zum jeweils benannten Stand. Bytes, Dokumente und Tokens sind unterschiedliche Maße; Tokenzahlen hängen vom Encoding ab.
Common Crawl
Common Crawl Foundation · Web
Crawl-ID / snapshot
Ein Archiv von Web-Crawls. Crawl-ID und Filter bestimmen die tatsächlichen Trainingsdaten. Der Archivzugang belegt keine einheitliche Lizenz für alle enthaltenen Seiten.
Originalquelle / DatenkarteThe Pile
EleutherAI · Gemischt
2020 paper · 825 GiB · 22 subsets
Eine historische englische Mischung aus 22 Komponenten. Herkunft und Rechte pro Komponente prüfen; die ursprüngliche Mischung enthält Books3. Ein Gesamtlabel wie legitim verdeckt diese Unterschiede.
Originalquelle / DatenkarteFineWeb
Hugging Face · Web
2024 release · 15T tokens
Gefilterter englischer Text aus Common Crawl. Die genannte Veröffentlichung ist ein historischer Stand, keine aktuelle Gesamtgröße. Die Datenkarte dokumentiert Verarbeitung und ODC-By-Bedingungen; Rechte der Quellinhalte sind gesondert zu betrachten.
Originalquelle / DatenkarteThe Stack v2
BigCode · Code
v2 · 67.5 TB (full corpus)
Code aus Software Heritage. Vollkorpus, deduplizierter Korpus und Trainings-Teilmengen haben unterschiedliche Größen. Datensatzbedingungen und ursprüngliche Repository-Lizenzen beachten; wegen Opt-outs eine Revision festhalten.
Originalquelle / DatenkarteCosmopedia
Hugging Face · Synthetisch
v0.1 · 2024
Mit Mixtral erzeugte synthetische Lehrtexte. Generator, Prompts, Ausgangsquellen und Validierung dokumentieren. Synthetisch beschreibt die Herstellung, nicht Qualität oder Rechtsstatus.
Originalquelle / DatenkarteQualität entsteht in der Verarbeitung
Deduplizierung, Sprachabdeckung, Filter und Sampling verändern, was ein Modell lernt. Einen getrennten Evaluationssatz halten, Überschneidungen mit Trainingsdaten prüfen und die Zielaufgaben messen. Ein größerer Korpus ist nicht automatisch besser. Strenge Filter können auch nützliche Dialekte, Sprachen oder Minderheitenperspektiven entfernen.
Synthetische Daten brauchen eine Herkunft
Modellerzeugte Daten können Instruktions-, Code- und Reasoning-Beispiele ergänzen. Generatorversion, Prompts, Ausgangsmaterial und Auswahlkriterien festhalten. Antworten möglichst mit aufgabenspezifischen Prüfungen validieren; Vielfalt und Kontamination evaluieren. Wiederholtes Training auf ungeprüften Modellausgaben kann Fehler verstärken oder Abdeckung verlieren. Das Ergebnis hängt von Auswahl, frischen Daten und Trainingsaufbau ab.
Zugang, Lizenzen und personenbezogene Daten getrennt erfassen
Öffentlich, offen, lizenziert und rechtmäßig sind keine austauschbaren Labels. Ein Datensatz kann Komponenten mit unterschiedlichen Bedingungen enthalten. Beschaffung, ursprüngliche Lizenzen, Opt-outs und Umgang mit personenbezogenen Daten dokumentieren. Eine Klage oder Behauptung braucht Quelle und Verfahrensstand; sie ist kein abschließendes Urteil über jede Trainingsnutzung.
Dokumentation allgemeiner KI-Modelle in der EU
Der AI Act enthält Pflichten für Anbieter von KI-Modellen mit allgemeinem Verwendungszweck (GPAI), darunter technische Dokumentation, eine Strategie zur Einhaltung des Urheberrechts und eine hinreichend detaillierte öffentliche Zusammenfassung der Trainingsinhalte. Anwendungsbereich, Ausnahmen und Übergangsregeln hängen von Anbieter und Modell ab. Die Pflichten betreffen nicht nur nachgelagerte Hochrisikosysteme. Maßgeblich für die aktuelle Einordnung sind die Leitlinien der Kommission.
Europäische Kommission: Leitlinien für GPAI-AnbieterWas ein Datensatzvergleich festhalten sollte
- Herausgeber und genaue Veröffentlichung oder Revision
- Quelldomains, Beschaffung und Verarbeitungsschritte
- Größe, Einheit, Tokenizer und Filterstufe
- Lizenzbedingungen und bekannte Herkunftslücken
- Aufteilung, Benchmark-Überschneidung und Evaluationsergebnisse