Menü

Werkzeuge durchsuchenÄnderungsprotokoll

zum Navigieren zum ÖffnenBeschreiben Sie das Problem, nicht das Tool

Wörter, Zeichen und Lesezeit zählen

Zählt Wörter, sichtbare Zeichen, Sätze, Absätze und häufige Wörter mit den Unicode-Segmentierungsregeln des Browsers. Zusätzlich berechnet es anpassbare Lese- und Vorlesezeiten.

Bis zu 2.000 Zeichen, weil der vollständige Zustand des Werkzeugs im Seitenlink übertragen wird.

238 Wörter pro Minute ist der metaanalytische Mittelwert für Erwachsene bei englischen Sachtexten.

Wörter
61
Wortgrenzen folgen den Unicode-Regeln in UAX #29, sodass auch Texte ohne Leerzeichen korrekt gezählt werden.
Zeichen
321
Zeichen ohne Leerzeichen
260
Sätze
4
Absätze
2
Unterschiedliche Wörter
49
Durchschnittliche Satzlänge
15,3
Lesezeit in Sekunden
15
Vorlesezeit in Sekunden
20

Häufigste Wörter

the46,56%
over34,92%
to34,92%
a23,28%
is23,28%
it23,28%
this23,28%
your23,28%
alphabet11,64%
and11,64%

So funktioniert es

Was gezählt wird

Das Ergebnis umfasst Wörter, Zeichen mit und ohne Leerraum, Sätze, Absätze, unterschiedliche Wörter, durchschnittliche Satzlänge sowie Lese- und Vorlesezeit. Eine Häufigkeitstabelle zeigt außerdem, welche Wörter den größten Anteil am Text haben.

Die wichtigste Entscheidung liegt an den Grenzen. Ein simples Aufteilen an Leerzeichen würde einen japanischen Absatz als ein einziges Wort behandeln und zusammengesetzte Emoji als mehrere Zeichen zählen. Dieses Werkzeug verwendet stattdessen Intl.Segmenter, also die Unicode-Segmentierung des Browsers.

Wörter und sichtbare Zeichen

Als Wort zählt ein Segment, das der Unicode-Algorithmus als wortartig markiert. Zahlen gehören dazu, Satzzeichen und Leerraum nicht. Apostrophe innerhalb eines Wortes bleiben verbunden; Bindestriche trennen.

Zeichen werden als Graphemcluster gezählt. Das entspricht eher dem, was ein Mensch auf dem Bildschirm als ein Zeichen wahrnimmt, als der technischen Länge einer JavaScript-Zeichenkette. Ein Buchstabe plus kombinierender Akzent zählt einmal, ebenso ein Emoji mit Hautfarbenton.

Sätze und Absätze

Unicode liefert die Satzgrenzen. Ein einzelnes Initial und eine kurze Liste häufiger englischer Abkürzungen werden zusätzlich mit dem folgenden Segment verbunden, damit etwa „Dr. Smith“ nicht als zwei Sätze erscheint. Diese Korrektur ist bewusst begrenzt und kann branchenspezifische oder deutsche Abkürzungen nicht vollständig kennen.

Absätze sind nicht leere Blöcke zwischen Leerzeilen. Ein einzelner Zeilenumbruch innerhalb eines Textblocks verändert die Absatzanzahl nicht.

Lesezeit richtig einordnen

Die Zeit ist eine einfache Division. Bei 476 Wörtern und 238 Wörtern pro Minute ergeben sich zwei Minuten stilles Lesen. Die Voreinstellungen stammen aus einer Metaanalyse von 190 Studien zu englischen Texten. Sie berücksichtigen weder die Schwierigkeit des Inhalts noch Sprache, Alter, Tabellen oder Denkpausen. Für einen deutschsprachigen Text sind sie ein anpassbarer Ausgangspunkt, keine versprochene Dauer.

So wird es gemacht

  1. Zerlege den Text mit Intl.Segmenter nach den Unicode-Wortregeln und zähle nur Segmente, die der Browser als wortartig kennzeichnet.
  2. Segmentiere denselben Text in Graphemcluster, damit kombinierende Akzente und zusammengesetzte Emoji als jeweils ein sichtbares Zeichen zählen.
  3. Ermittle Satzgrenzen nach Unicode und verbinde Segmente wieder, wenn der vorherige Teil mit einem einzelnen Initial oder einer bekannten Abkürzung endet.
  4. Zähle Absätze als nicht leere Textblöcke, die durch mindestens eine Leerzeile getrennt sind.
  5. Normalisiere Wörter je nach Auswahl mit oder ohne Großschreibungsunterscheidung und bilde daraus die Zahl unterschiedlicher Wörter sowie die Häufigkeitstabelle.
  6. Teile die Wortzahl durch die gewählten Wörter-pro-Minute-Werte und gib die Lese- und Vorlesezeit in Sekunden aus.

Wovon es ausgeht

  • Wortgrenzen folgen Unicode UAX
  • Zahlen gelten als wortartige Segmente. Leerzeichen, Satzzeichen und alleinstehende Symbole werden nicht als Wörter gezählt.
  • Zeichen sind Graphemcluster und nicht UTF-16-Codeeinheiten. Ein Emoji mit Hautfarbenton oder ein Buchstabe mit kombinierendem Akzent zählt als ein sichtbares Zeichen.
  • Die zusätzliche Abkürzungsliste für Satzgrenzen ist lateinisch und englisch geprägt. Sie enthält einzelne Initialen sowie häufige Formen wie Mr, Dr, Prof und vs, aber keine vollständige Liste deutscher Abkürzungen.
  • Ein Absatz ist ein nicht leerer Block zwischen Leerzeilen. Ein einzelner manueller Zeilenumbruch innerhalb eines Blocks beginnt keinen neuen Absatz.
  • Die voreingestellten 238 Wörter pro Minute still und 183 Wörter pro Minute laut stammen aus einer Metaanalyse englischer Texte für Erwachsene. Sprache, Alter und Textschwierigkeit können deutlich abweichen.
  • Lesezeit ist ausschließlich Wortzahl geteilt durch Geschwindigkeit. Tabellen, Formeln, ungewohnte Begriffe und Denkpausen werden nicht modelliert.

Fragen

Wird mein eingegebener Text hochgeladen?

Nein. Alle Zählungen laufen in diesem Browser-Tab. Der Text kann im Fragment eines Freigabelinks stehen; dieser Fragmentteil wird bei einer Webanfrage nicht an den Server übertragen.

Warum ist die Eingabe auf 2.000 Zeichen begrenzt?

Der vollständige Zustand des Werkzeugs soll in einem teilbaren Link erhalten bleiben. Zwei Tausend Zeichen ergeben bereits einen langen, aber in Nachrichten noch robust übertragbaren Link. Für ganze Dokumente wäre ein lokaler Datei-Import die passendere Oberfläche.

Wie zählt das Werkzeug Japanisch oder Chinesisch ohne Leerzeichen?

Intl.Segmenter verwendet die Unicode-Regeln und die im Browser mitgelieferten Sprachdaten. Es ist deshalb nicht auf das Trennen an Leerzeichen beschränkt und kann auch Schriften segmentieren, in denen zwischen Wörtern kein sichtbarer Abstand steht.

Warum zählt state-of-the-art als vier Wörter?

Nach UAX #29 ist ein Bindestrich eine Wortgrenze, ein Apostroph innerhalb eines Wortes dagegen nicht. Deshalb ist ein englisches don't ein Wort, während die vier Bestandteile von state-of-the-art einzeln gezählt werden. Andere Schreibprogramme können hiervon abweichen.

Warum zählt das Werkzeug manchmal einen Satz mehr als ich?

Meist wurde ein Punkt nach einer Abkürzung als Satzende erkannt. Eine begrenzte Liste häufiger Formen und einzelne Initialen werden korrigiert, aber keine Liste kann jede Fach-, Firmen- oder Sprachabkürzung sicher erfassen.

Welche Lesegeschwindigkeit sollte ich einstellen?

Die Vorgaben sind Mittelwerte aus Studien mit englischen Texten für Erwachsene, keine Zielwerte. Für schwierige Fachtexte, eine Zweitsprache oder einen Vortrag sind niedrigere Werte sinnvoll. Die beiden Felder lassen sich deshalb unabhängig anpassen.

Quellen