Aus dem Englischen übersetzt

SQuAD v1.1 ist ein Leseverständnis-Datensatz mit über 100.000 Frage-Antwort-Paaren, die aus Wikipedia-Artikeln abgeleitet wurden und zur Bewertung von extraktiven Frage-Antwort-Systemen verwendet werden. Er wurde 2016 von der Stanford University eingeführt.

SQuAD v1.1 (Stanford Question Answering Dataset) ist ein weit verbreiteter Benchmark-Datensatz für extraktives Leseverständnis und Fragebeantwortung. Er besteht aus über 100.000 Frage-Antwort-Paaren, die von Crowdworkern auf der Grundlage von 536 Wikipedia-Artikeln erstellt wurden. Die Aufgabe erfordert, dass ein Modell die korrekte Antwort als zusammenhängenden Textabschnitt innerhalb eines gegebenen Absatzes identifiziert, was ihn zu einer grundlegenden Bewertungsgrundlage für Systeme zum Verständnis natürlicher Sprache macht.

Der Datensatz wurde 2016 von Forschern des Stanford AI Lab eingeführt, wobei die erste Version im Juni 2016 veröffentlicht wurde und das v1.1-Update im Dezember 2016 erschien. Er wurde entwickelt, um die Entwicklung von Modellen zu fördern, die Texte auf einem Niveau lesen und verstehen können, das näher an der menschlichen Leistung liegt. Die Fragen sind so gestaltet, dass sie ausschließlich anhand des bereitgestellten Absatzes beantwortet werden können, ohne dass externes Wissen erforderlich ist, und jede Frage hat genau eine korrekte Antwortspanne.

Struktur und Erstellung

SQuAD v1.1 wurde erstellt, indem 536 Artikel aus der englischen Wikipedia ausgewählt wurden, die eine Vielzahl von Themen abdecken, darunter Wissenschaft, Geschichte und Biografie. Crowdworker auf Amazon Mechanical Turk wurden gebeten, jeden Absatz zu lesen und Fragen sowie entsprechende Antworten zu generieren. Jede Antwort musste eine wörtliche Textspanne des Absatzes sein, um sicherzustellen, dass der Datensatz für extraktive QA-Aufgaben verwendet werden kann. Der endgültige Datensatz enthält 107.785 Frage-Antwort-Paare, aufgeteilt in einen Trainingssatz mit 87.599 Paaren, einen Entwicklungssatz mit 10.570 Paaren und einen versteckten Testsatz für die offizielle Bewertung.

Der Datensatz umfasst eine Vielzahl von Fragetypen, wie Wer-, Was-, Wann-, Wo-, Warum- und Wie-Fragen. Diese Vielfalt fordert Modelle heraus, verschiedene Arten des Denkens durchzuführen, einschließlich Entitätserkennung, zeitlichem Denken und kausaler Inferenz. Die Antwortspannen reichen von einzelnen Token bis zu mehrsätzigen Passagen, obwohl die meisten kurze Phrasen sind.

Bewertungsmetriken

Modelle werden anhand von zwei primären Metriken bewertet: Exact Match (EM) und F1-Score. EM misst den Prozentsatz der Vorhersagen, die exakt mit der Ground-Truth-Antwort übereinstimmen, wobei Interpunktion und Artikel ignoriert werden. Der F1-Score berechnet das harmonische Mittel von Präzision und Recall zwischen den vorhergesagten und den Ground-Truth-Tokens und bietet ein nachsichtigeres Maß, das teilweise Übereinstimmungen belohnt. Diese Metriken sind zum Standard im Bereich des Leseverständnisses geworden und werden in vielen nachfolgenden Datensätzen verwendet.

Die menschliche Leistung auf SQuAD v1.1 wird auf 82,3 EM und 91,2 F1 geschätzt und bietet einen Referenzpunkt für den Modellvergleich. Frühe Modelle hatten Schwierigkeiten, 50% F1 zu überschreiten, aber schnelle Fortschritte im Deep Learning und bei Neuronale-Netze-Architekturen führten innerhalb weniger Jahre zu erheblichen Verbesserungen.

Auswirkungen und Vermächtnis

SQuAD v1.1 spielte eine zentrale Rolle bei der Förderung der Forschung im Bereich maschinelles Lernen und künstliche Intelligenz. Er bot einen standardisierten, groß angelegten Benchmark, der es Forschern ermöglichte, Modellleistungen objektiv zu vergleichen. Der Datensatz förderte die Entwicklung vieler einflussreicher Architekturen, einschließlich der Transformer-basierten Modelle, die später die Grundlage moderner großer Sprachmodelle wurden.

Bemerkenswerterweise fiel die Veröffentlichung von SQuAD v1.1 mit dem Aufstieg von Aufmerksamkeitsmechanismen und Multi-Head-Attention in der Verarbeitung natürlicher Sprache zusammen. Modelle wie BiDAF (Bidirectional Attention Flow) und später BERT erzielten State-of-the-Art-Ergebnisse auf diesem Benchmark und demonstrierten die Leistungsfähigkeit von Pretraining- und Fine-Tuning-Paradigmen. Der Erfolg dieser Modelle auf SQuAD v1.1 half, die Wirksamkeit der Encoder-Decoder- und Sequence-to-Sequence-Rahmenwerke zu validieren.

Der Datensatz beeinflusste auch die Erstellung nachfolgender Benchmarks, einschließlich SQuAD v2.0, das unbeantwortbare Fragen hinzufügte, um die Robustheit von Modellen zu testen. Viele andere Datensätze zum Leseverständnis, wie RACE und TriviaQA, wurden nach ähnlichen Prinzipien entworfen, aber SQuAD v1.1 bleibt einer der am häufigsten zitierten und am weitesten verbreiteten Benchmarks in diesem Bereich.

Einschränkungen und Kritik

Trotz seines Erfolgs hat SQuAD v1.1 mehrere Einschränkungen. Die extraktive Natur der Aufgabe bedeutet, dass Modelle nur eine Textspanne identifizieren müssen, anstatt neuartige Antworten zu generieren. Dies kann zu Modellen führen, die gut darin sind, Informationen zu lokalisieren, aber weniger fähig sind, darüber zu synthetisieren oder zu argumentieren. Der Datensatz stützt sich auch auf Wikipedia-Artikel, was Verzerrungen in der Themenabdeckung und im Schreibstil einführen kann.

Darüber hinaus enthalten die Crowd-sourced Fragen manchmal Mehrdeutigkeiten oder erfordern gesunden Menschenverstand, der nicht explizit im Absatz angegeben ist. Als sich Modelle verbesserten, verringerte sich die Lücke zwischen menschlicher und maschineller Leistung, was Bedenken hinsichtlich der Fähigkeit des Datensatzes aufwarf, zwischen Top-Performing-Systemen zu unterscheiden. Diese Probleme motivierten die Erstellung anspruchsvollerer Benchmarks und die Erforschung von generativer KI-Ansätzen, die über extraktives Antworten hinausgehen.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:natural-language-processing·dataset·question-answering·benchmark
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte