Menü

Werkzeuge durchsuchenÄnderungsprotokoll

zum Navigieren zum ÖffnenBeschreiben Sie das Problem, nicht das Tool

Entfernen Sie eine UTF-8-Stückliste aus einer Textdatei

Lesen Sie die Datei mithilfe der automatischen Erkennung, schreiben Sie sie als UTF-8 und lassen Sie die Markierung für die Bytereihenfolge deaktiviert. Der führende EF BB BF-Marker wird während der Dekodierung verbraucht und nicht in die neue Datei geschrieben. Der Text selbst und standardmäßig alle Zeilenenden bleiben unverändert.

Eine reine Textdatei mit bis zu 25 MB. Binärformate wie Word-Dokumente sind keine Textkodierungen und werden abgelehnt.

Auto erkennt die drei standardmäßigen Unicode-Bytereihenfolgemarkierungen. Ohne eine solche ist UTF-8 die einzige sichere Standardeinstellung.

Fügt EF BB BF für UTF-8, FF FE für UTF-16LE oder FE FF für UTF-16BE hinzu. Viele moderne UTF-8-Workflows benötigen keine Stückliste.

Unicode-Codepunkte
Zeichen nach der Dekodierung, wobei ein zusätzliches Zeichen einmal gezählt wird und nicht als zwei UTF-16-Codeeinheiten.
Lesen Sie als
Geschrieben als
Eingabebytes
Ausgabebytes

Die Ergebnisse werden ohne Gewähr für ihre Richtigkeit bereitgestellt. Die Methode und ihre Quellen stehen unten, damit Sie den Rechenweg prüfen können.

Das Wichtigste
  1. Eine UTF-8-Stückliste besteht aus drei Bytes (EF BB BF) am Anfang der Datei.

  2. Durch das Entfernen wird die Codierungsmarkierung geändert, nicht das erste sichtbare Zeichen.

  3. Die vollständige Konvertierung erfolgt im Browser und erzeugt eine separate Datei.

So funktioniert es

So wird es gemacht

  1. Überprüfen Sie die ersten drei Bytes auf EF BB BF (UTF-8), FF FE (UTF-16LE) oder FE FF (UTF-16BE). Im automatischen Modus wählt der Markierer den Decoder; ohne eine benötigen Sie UTF-8, anstatt eine alte Codepage zu erraten.
  2. Wenn die Quellkodierung manuell ausgewählt wird, ist die Zustimmung aller vorhandenen Markierungen erforderlich. Entfernen Sie die vereinbarte Markierung und dekodieren Sie dann im Fatal-Modus, sodass eine illegale Bytesequenz die Konvertierung stoppt, anstatt zu einem stillen Ersatzzeichen zu werden.
  3. Behalten Sie standardmäßig jede CR-, LF- und CRLF-Sequenz bei. Nur wenn diese Option ausgewählt ist, werden alle drei Formen als separater Vorgang von der Zeichenkodierung auf LF oder CRLF normalisiert.
  4. Zählen Sie Unicode-Codepunkte und behandeln Sie ein gültiges UTF-16-Ersatzzeichenpaar als ein zusätzliches Zeichen. Kodieren Sie die resultierende Zeichenfolge als UTF-8-Bytes oder als Zwei-Byte-UTF-16-Codeeinheiten in der ausgewählten Bytereihenfolge.
  5. Fügen Sie den ausgewählten Zielmarker – EF BB BF, FF FE oder FE FF – nur hinzu, wenn Sie dazu aufgefordert werden, und bieten Sie dann eine separate TXT-Datei an. Die Quelldatei wird nie geändert.

Wovon es ausgeht

  • Auto ist absichtlich auf die drei Unicode-Bytereihenfolgemarkierungen beschränkt. Eine nicht markierte Datei verwendet standardmäßig das strikte UTF-8; Windows-1252-, ISO-8859-Varianten und andere ältere Codepages können nicht zuverlässig anhand von Bytes allein unterschieden werden.
  • Eine Bytereihenfolgemarkierung am Anfang stellt Metadaten dar und wird vor dem ersten Textzeichen verbraucht. Ein U+FEFF weiter unten in der Datei ist Inhalt und bleibt Inhalt.
  • UTF-8 hat keine Frage zur Bytereihenfolge; seine Stückliste ist nur eine Signatur. UTF-16LE und UTF-16BE serialisieren dieselben 16-Bit-Codeeinheiten in entgegengesetzter Bytereihenfolge.
  • Ungültige UTF-Sequenzen werden abgelehnt statt repariert. Die Eingabeobergrenze beträgt 25 MB und die Codepunkt- und UTF-16-Schleifen ergeben alle 250.000 Codeeinheiten für Fortschritt und Abbruch.

Fragen

Warum kann eine Stückliste aus seltsamen Zeichen bestehen?

Software, die die Bytes mit der falschen Legacy-Kodierung dekodiert, zeigt möglicherweise EF BB BF als sichtbaren Text an. Ein Unicode-fähiger Decoder verbraucht die Markierung, bevor das erste Zeichen verfügbar gemacht wird.

Wird sich durch das Entfernen der Stückliste die Endung der CRLF-Zeilen ändern?

Nicht, wenn „Konservieren“ genau ausgewählt ist. Die Stücklistenverwaltung und die Konvertierung am Zeilenende sind separate Steuerelemente.

Quellen

Die vollständige Methode, das Rechenbeispiel und alle Annahmen hinter diesem Ergebnis stehen auf Textkodierungskonverter.