Zusammenfassungen nach dem KI‑Gesetz listen gescrapte Domains nicht auf, prüft Studie
Eine Analyse von 24 öffentlich verfügbaren Zusammenfassungen zum KI‑Gesetz zeigt, dass kein Dokument die gescrapten Domains im vorgesehenen Abschnitt aufführt, was Fragen zur Einhaltung der EU‑Vorlage aufwirft.

ActuIA hat 24 Zusammenfassungen von Trainingsinhalten untersucht, die am 25. September 2026 öffentlich zugänglich waren und jeweils den Meldepflichten nach Artikel 53(1)(d) des KI‑Gesetzes entsprechen.
Die Vorlage der Europäischen Kommission verlangt von Anbietern, die ersten und zweiten Ebene‑Domains aufzulisten, die die größten zehn Prozent der gescrapten Webseiten nach Volumen ausmachen, mit einem niedrigeren Schwellenwert für kleine und mittlere Unternehmen (KMU).
Mehrheit der Zusammenfassungen lässt Domain‑Listen weg
Einundzwanzig der geprüften Dokumente enthielten den Vorlagenabschnitt für wichtige gescrapte Domains, ließen das Feld jedoch leer und nannten keinerlei Webseiten.
Drei von DeepSeek eingereichte Zusammenfassungen ließen den Abschnitt zum Web‑Scraping vollständig weg, sodass die geforderte Information im Dokument fehlt.
Wie Anbieter ihre Datenquellen beschreiben
Statt einzelne Domains aufzulisten, nutzten die Zusammenfassungen breite Kategorien wie akademische Ressourcen, Code‑Hosting‑Plattformen, Enzyklopädien, regionale Portale oder generische Endungen wie .com.
Zu den abgedeckten Anbietern gehören OpenAI, Mistral AI, Z.AI, ByteDance, MiniMax, DeepSeek und elf neue Dokumente von Ant Group.
Ant Groups Dokumentation auf Hugging Face
Die Zusammenfassungen von Ant Group wurden im inclusionAI/AI‑Transparency‑Repository auf Hugging Face veröffentlicht. Das Repository weist darauf hin, dass es ausschließlich Dokumentation, nicht Modellgewichte oder Trainingsdatensätze enthält, und dass die Veröffentlichung keine regulatorische Zertifizierung darstellt.
Diese Ant‑Dokumente folgen der Vorlage nach Artikel 53(1)(d), lassen jedoch das Feld für die Domain‑Auflistung leer, was dem Muster im gesamten Stichprobenumfang entspricht.
Regulatorischer Kontext und Fristen
Die Verpflichtung des KI‑Gesetzes, gescrapte Domain‑Informationen offenzulegen, gilt für neu vermarktete General‑Purpose‑Modelle ab dem 2. August 2025. Für bereits existierende Modelle besteht eine Übergangsfrist bis zum 2. August 2027.
Ob die aktuellen Beschreibungen die gesetzlichen Anforderungen des Artikels 53 erfüllen, entscheidet die Europäische Kommission; die vorliegende Überprüfung stellt selbst keine Rechtswidrigkeit fest.
- 21 Zusammenfassungen enthalten die Vorlage, listen aber keine Domains auf
- 3 DeepSeek‑Zusammenfassungen lassen den Abschnitt komplett weg
- Anbieter verwenden generische Kategorien statt konkreter URLs
- Ant Groups Hugging‑Face‑Repository stellt klar, dass Dokumente keine Zertifizierung darstellen
Die vorliegende Untersuchung macht deutlich, dass die formale Erfüllung der Meldepflicht nach Artikel 53(1)(d) zwar in den meisten Zusammenfassungen nominal umgesetzt wird, die inhaltliche Substanz jedoch stark hinter den regulatorischen Vorgaben zurückbleibt. Während die Dokumente den vorgesehenen Abschnitt für die Auflistung der wichtigsten gescrapten Domains enthalten, bleibt das Feld leer, was aus Sicht der Aufsichtsbehörden als unvollständige Angabe interpretiert werden kann. Die Konsequenz ist, dass die reine Präsenz des Abschnitts nicht automatisch als Nachweis der Konformität gilt; vielmehr wird von den Behörden erwartet, dass konkrete Domain‑Namen angegeben werden, um die Transparenz und Rückverfolgbarkeit der genutzten Datenquellen zu gewährleisten. Dieser Umstand stellt ein zentrales Prüfungsmerkmal dar, das in zukünftigen Audits vermehrt berücksichtigt werden dürfte.
Ein weiteres wesentliches Problem ergibt sich aus der Praxis, dass Anbieter stattdessen breit gefasste Kategorien anführen, etwa akademische Ressourcen oder generische Top‑Level‑Domains. Diese Vorgehensweise erschwert jedoch die objektive Bewertung, ob die geforderte Schwelle von zehn Prozent der gescrapten Webseiten tatsächlich erreicht wird. Ohne konkrete URLs lässt sich nicht prüfen, ob die angegebenen Kategorien die relevanten Datenmengen repräsentieren oder ob sie lediglich als Platzhalter dienen, um die formale Vorgabe zu umgehen. Die fehlende Granularität reduziert zudem die Möglichkeit, potenzielle Risiken, wie die ungewollte Einbeziehung urheberrechtlich geschützter Inhalte, systematisch zu identifizieren und zu mitigieren.
Die Analyse verdeutlicht zudem, dass die aktuelle Methodik der Selbstdeklaration durch die Anbieter nicht ausreichend ist, um die Wirksamkeit der regulatorischen Maßnahme zu garantieren. Da die Europäische Kommission die letztendliche Bewertung vornimmt, besteht ein erhebliches Risiko, dass die vorliegenden Dokumente bei einer Prüfung als nicht konform eingestuft werden. In einem solchen Fall könnte die Kommission zusätzliche Informationen anfordern oder die Anbieter auffordern, ihre Zusammenfassungen zu überarbeiten und die fehlenden Domain‑Listen nachzuliefern. Dieser mögliche Auflagenprozess würde nicht nur administrative Kosten erhöhen, sondern auch die Markteinführungszeit für betroffene KI‑Modelle verzögern.
Ein weiterer Aspekt betrifft die unterschiedliche Behandlung von kleinen und mittleren Unternehmen (KMU), für die ein niedrigerer Schwellenwert gilt. Da die vorliegenden Zusammenfassungen keine spezifischen Domains angeben, ist nicht nachvollziehbar, ob die jeweiligen Anbieter die für KMU geltenden Erleichterungen korrekt angewendet haben. Ohne klare Nachweise kann die Aufsichtsbehörde nicht beurteilen, ob die regulatorische Differenzierung wirksam umgesetzt wurde, was zu Unsicherheiten bei der Gleichbehandlung von Unternehmen unterschiedlicher Größe führen kann. Diese Unklarheit könnte dazu führen, dass KMU in einem überproportionalen Aufwand gefordert werden, um ihre Konformität zu belegen.
Die praktische Auswirkung für Unternehmen im deutschsprachigen Raum besteht darin, dass sie proaktiv Maßnahmen ergreifen sollten, um die Lücken in ihren Zusammenfassungen zu schließen. Dies beinhaltet die Sammlung und Dokumentation der tatsächlich genutzten Domains sowie die Integration dieser Informationen in die bestehenden Berichte. Darüber hinaus sollten Unternehmen interne Prozesse etablieren, die eine regelmäßige Überprüfung der Vollständigkeit und Aktualität der gemeldeten Daten sicherstellen, um mögliche Rückfragen der Aufsichtsbehörden frühzeitig zu antizipieren. Ein systematischer Ansatz zur Daten‑ und Dokumentationsverwaltung kann somit das Risiko von Compliance‑Verstößen signifikant reduzieren.
Schließlich ist zu beachten, dass die derzeitige Praxis der unvollständigen Domain‑Angaben nicht nur regulatorische Risiken birgt, sondern auch das Vertrauen von Nutzern und Partnern in die Transparenz von KI‑Entwicklern beeinträchtigen kann. Durch die konsequente Bereitstellung detaillierter Domain‑Listen können Anbieter nicht nur den gesetzlichen Anforderungen genügen, sondern auch ein stärkeres Signal für verantwortungsbewusste Datenpraktiken setzen. Langfristig könnte dies zu einer positiveren Wahrnehmung im Markt führen und gleichzeitig die Grundlage für zukünftige regulatorische Anpassungen schaffen, die auf klaren, nachprüfbaren Informationen basieren.
Für deutschsprachige Unternehmen ist die praktische Auswirkung eindeutig: Ohne explizite Domain‑Auflistungen können Compliance‑Prüfungen die Angaben als unvollständig markieren, was zu Anfragen nach zusätzlichen Informationen oder Korrekturmaßnahmen seitens der EU‑Aufsichtsbehörden führen kann. Unternehmen sollten bereit sein, ihre bestehenden Zusammenfassungen mit konkreten Domain‑Daten zu ergänzen, falls die Kommission das aktuelle Vorgehen als nicht ausreichend für Artikel 53 einstuft.
Quellen
- Résumés AI Act : 21 documents sur 24 ne nomment aucun site moissonné dans la rubrique prévueActuIA · 25. September 2026
- Ant Ling — Training Content SummariesHugging Face · 24. September 2026



