فهرست

جست‌وجوی ابزارهاگزارش تغییرات

برای جابه‌جایی برای باز کردنمسئله را توضیح دهید، نه نام ابزار را

BOM UTF-۸ را از یک فایل متنی حذف کنید

فایل را با تشخیص خودکار بخوانید، آن را به‌صورت UTF-۸ بنویسید و نشانهٔ ترتیب بایت را خاموش بگذارید. نشانهٔ آغازین EF BB BF هنگام رمزگشایی مصرف می‌شود و در فایل جدید نوشته نمی‌شود. خود متن و، به‌طور پیش‌فرض، پایان هر خط بدون تغییر می‌ماند.

یک فایل متنی ساده تا ۲۵ مگابایت. قالب‌های باینری مانند اسناد Word کدگذاری متنی نیستند و رد می‌شوند.

حالت خودکار سه نشانهٔ ترتیب بایت استاندارد یونیکد را تشخیص می‌دهد. بدون نشانه، UTF-۸ تنها پیش‌فرض امن است.

EF BB BF را برای UTF-۸، FF FE را برای UTF-۱۶LE یا FE FF را برای UTF-۱۶BE اضافه می‌کند. بسیاری از گردش‌کارهای مدرن UTF-۸ به BOM نیازی ندارند.

نقاط کد یونیکد
نویسه‌ها پس از رمزگشایی؛ یک نویسهٔ تکمیلی یک بار شمرده می‌شود، نه به‌صورت دو واحد کد UTF-۱۶.
خوانده‌شده به‌صورت
نوشته‌شده به‌صورت
بایت‌های ورودی
بایت‌های خروجی

نتیجه‌ها بدون تضمین درستی ارائه می‌شوند. روش و منابع در پایین صفحه منتشر شده‌اند تا بتوانید محاسبه را بررسی کنید.

نکات اصلی
  1. BOM UTF-۸ سه بایت — EF BB BF — در ابتدای فایل است.

  2. حذف آن نشانهٔ کدگذاری را تغییر می‌دهد، نه اولین نویسهٔ قابل‌مشاهده را.

  3. تبدیل به‌طور کامل در مرورگر انجام می‌شود و یک فایل جداگانه تولید می‌کند.

چگونگی کار

مراحل انجام کار

  1. سه بایت اول را برای EF BB BF (UTF-۸)، FF FE (UTF-۱۶LE) یا FE FF (UTF-۱۶BE) بررسی کنید. در حالت خودکار، نشانه رمزگشا را انتخاب می‌کند؛ بدون نشانه، به‌جای حدس زدن یک صفحه‌کد قدیمی، UTF-۸ را الزامی کنید.
  2. وقتی کدگذاری منبع دستی انتخاب شده، هر نشانهٔ موجود باید با آن سازگار باشد. نشانهٔ سازگار را بردارید، سپس در حالت سخت‌گیر (fatal) رمزگشایی کنید تا یک توالی بایت نامجاز تبدیل را متوقف کند، نه این‌که بی‌سروصدا به نویسهٔ جایگزین تبدیل شود.
  3. هر توالی CR، LF و CRLF را به‌طور پیش‌فرض حفظ کنید. فقط در صورت انتخاب، هر سه شکل را به‌عنوان عملیاتی جدا از کدگذاری نویسه‌ها به LF یا به CRLF یکسان‌سازی کنید.
  4. نقاط کد یونیکد را بشمارید و یک جفت جانشین (surrogate) معتبر UTF-۱۶ را یک نویسهٔ تکمیلی به حساب آورید. رشتهٔ حاصل را به‌صورت بایت‌های UTF-۸ یا واحدهای کد دوبایتی UTF-۱۶ با ترتیب بایت انتخاب‌شده کدگذاری کنید.
  5. نشانهٔ مقصد انتخاب‌شده — EF BB BF، FF FE یا FE FF — را فقط در صورت درخواست اضافه کنید، سپس یک فایل .txt جداگانه ارائه دهید. فایل منبع هرگز تغییر نمی‌کند.

فرض‌ها

  • حالت خودکار عمداً به سه نشانهٔ ترتیب بایت یونیکد محدود است. فایل بدون نشانه به‌طور پیش‌فرض UTF-۸ سخت‌گیرانه در نظر گرفته می‌شود؛ Windows-۱۲۵۲، گونه‌های ISO-۸۸۵۹ و دیگر صفحه‌کدهای قدیمی را نمی‌توان تنها از روی بایت‌ها به‌طور قابل‌اعتماد تشخیص داد.
  • نشانهٔ ترتیب بایت در ابتدای فایل فراداده است و پیش از اولین نویسهٔ متن مصرف می‌شود. یک U+FEFF در ادامهٔ فایل محتواست و محتوا می‌ماند.
  • UTF-۸ مسئلهٔ ترتیب بایت ندارد؛ BOM آن فقط یک امضاست. UTF-۱۶LE و UTF-۱۶BE همان واحدهای کد ۱۶ بیتی را با ترتیب بایت مخالف سریال‌سازی می‌کنند.
  • توالی‌های نامعتبر UTF به‌جای تعمیر رد می‌شوند. سقف ورودی ۲۵ مگابایت است و حلقه‌های شمارش نقاط کد و UTF-۱۶ هر ۲۵۰٬۰۰۰ واحد کد برای گزارش پیشرفت و امکان لغو، کنترل را واگذار می‌کنند.

پرسش‌های رایج

چرا BOM ممکن است به‌صورت نویسه‌های عجیب ظاهر شود؟

نرم‌افزاری که بایت‌ها را به اشتباه با یک کدگذاری قدیمی رمزگشایی می‌کند، ممکن است EF BB BF را به‌صورت متن قابل‌مشاهده نشان دهد. یک رمزگشای آگاه از یونیکد این نشانه را پیش از نمایش اولین نویسه مصرف می‌کند.

آیا حذف BOM پایان خطوط CRLF را تغییر می‌دهد؟

با گزینهٔ «دقیقاً حفظ شود» خیر. مدیریت BOM و تبدیل پایان خط دو کنترل جداگانه هستند.

منابع

  • Encoding StandardWHATWGبررسی‌شده در مربوط به استاندارد زنده، اوت ۲۰۲۶
  • UTF-8, UTF-16, UTF-32 & BOM FAQThe Unicode Consortiumبررسی‌شده در مربوط به شکل‌های کدگذاری یونیکد و راهنمای نشانهٔ ترتیب بایت
  • RFC 3629: UTF-8, a transformation format of ISO 10646RFC Editor / Internet Engineering Task Forceبررسی‌شده در مربوط به مسیر استانداردها، نوامبر ۲۰۰۳

روش کامل، مثال محاسبه‌شده و همهٔ فرض‌های این نتیجه در این صفحه آمده است: مبدل کدگذاری متن.