OpenSubtitles 2018
Film- und Fernsehuntertitel. Hervorragend für Alltagsspanisch — und der Grund, warum eine Liste allein daraus Grußformeln und Interjektionen zu weit oben führt.
Die ganze Seite steht und fällt mit einer Behauptung: dass dies die echte Häufigkeitsreihenfolge des Spanischen ist. Das ist nur etwas wert, wenn der Rechenweg sichtbar ist — hier ist er.
Film- und Fernsehuntertitel. Hervorragend für Alltagsspanisch — und der Grund, warum eine Liste allein daraus Grußformeln und Interjektionen zu weit oben führt.
Spanischsprachiger Journalismus. Bringt den Wortschatz des öffentlichen Lebens mit — Politik, Wirtschaft, Recht —, den Dialog kaum berührt.
Spanische Wikipedia. Formale, beschreibende Prosa, und die Quelle, die abstrakten und fachlichen Wortschatz im richtigen Verhältnis hält.
Ein einzelnes Korpus ist ein Genre, keine Sprache. Untertitel allein brächten dir bei, einem Film zu folgen, und ließen dich in der Zeitung stehen; Wikipedia allein genau umgekehrt. Jedes Wort wird danach eingeordnet, wie es sich in allen drei verhält.
Die Korpora sind unterschiedlich groß, rohe Zählungen sind also nicht vergleichbar. Jedes wird zuerst in Vorkommen pro Million Wörter umgerechnet.
Die drei Raten werden im Logarithmus gemittelt. Das belohnt ein Wort, das überall mittelhäufig ist, gegenüber einem, das nur in einem Register ausschlägt — und genau das sollte „am häufigsten“ heißen.
Eigennamen, erkannt daran, wie oft das Wort in den Quellen großgeschrieben auftaucht. Dazu Abkürzungen, Füllwörter und Schreibungen ohne Akzent, deren korrekte Form bereits in der Liste steht. Ein Wort muss in mindestens zwei Korpora vorkommen, um überhaupt zu ranken.
Übersetzungen, Wortart, Niveau und ein Beispielsatz werden von Hand geschrieben. Die Aussprache wird aus der Schreibung abgeleitet statt gespeichert, weil die spanische Orthographie regelmäßig genug dafür ist.
Weit oben in einer reinen Untertitelliste, deutlich tiefer, sobald Nachrichten und Enzyklopädie dazukommen:
Ganz gewöhnliches Spanisch, das im Dialog kaum vorkommt und das eine Untertitelliste aus den ersten tausend herausgelassen hätte:
Alle 5.000 sind gerankt — und alle 5.000 sind übersetzt: jedes Wort hat eine englische und eine deutsche Entsprechung, eine Wortart, ein GER-Niveau und einen Beispielsatz. Der Wortschatztest kann also die ganze Liste nutzen und über die ganze Liste messen. Erst ganz oben, ab etwa 4.750, nennt er eine Untergrenze statt einer Zahl — weil es keine selteneren Wörter mehr gibt, mit denen er prüfen könnte.