Перейти к содержимому
Aback Tools Logo

Просмотр кодовых точек Unicode

Смотрите подробную информацию Unicode о каждом символе любого текста с помощью нашего бесплатного онлайн-просмотра кодовых точек Unicode. Вставьте или введите любой текст, чтобы мгновенно увидеть кодовую точку U+ каждого символа, его официальное название Unicode, общую категорию (Lu, Ll, Nd, Po и т. д.), блок Unicode и полные последовательности байтов UTF-8 и UTF-16. Фильтруйте по категории или блоку, ищите по названию или кодовой точке и изучайте подробные данные по каждому символу - всё обрабатывается локально в браузере без отправки на сервер. Без регистрации.

Unicode Code Point Viewer

Paste or type any text to view detailed Unicode information for each character - code point, name, category, block, UTF-8 and UTF-16 byte sequences, and more. All processing is local.

Text Input
0 code points

Paste or type text above to view detailed Unicode code point information for every character.

Зачем использовать наш просмотрщик кодовых точек Unicode?

  • Полная информация Unicode: смотрите все детали о каждом символе текста - кодовую точку Unicode (U+), десятичное значение, официальное название символа, общую категорию, блок Unicode и последовательности байтов UTF-8/UTF-16 - в понятной таблице с сортировкой.
  • Анализ в реальном времени: получайте мгновенный анализ кодовых точек Unicode по мере ввода или вставки текста. Сводные карточки показывают общее число кодовых точек, количество букв, цифр, знаков пунктуации и символов, а также общие размеры в байтах для UTF-8 и UTF-16 - данные обновляются в реальном времени.
  • Мощные фильтры и поиск: фильтруйте кодовые точки по категории (Lu, Ll, Nd, Po и т. д.) или блоку Unicode одним кликом. Ищите по кодовой точке, названию символа, блоку или любому атрибуту. Нажмите на строку, чтобы открыть подробный вид с копируемыми значениями.
  • 100 % бесплатно и приватно: наш просмотрщик кодовых точек Unicode полностью бесплатный, без регистрации, рекламы и ограничений на использование. Весь анализ выполняется локально в браузере - текст никогда не покидает устройство. Данные не загружаются на серверы.

Типичные сценарии использования просмотрщика кодовых точек Unicode

  • Отладка проблем кодировки: когда текст отображается нечитаемыми символами или «кракозябрами», используйте просмотрщик кодовых точек Unicode, чтобы изучить каждый символ на уровне байтов. Сравнивайте последовательности UTF-8 и UTF-16, чтобы найти несоответствия кодировки и исправить повреждённый текст.
  • Разработка и тестирование ПО: разработчики могут использовать просмотрщик для проверки обработки Unicode в своих приложениях - убедиться, что обработка строк корректно работает с многобайтовыми символами, суррогатными парами, комбинирующими метками и символами нулевой ширины во время разработки и тестирования.
  • Работа над интернационализацией (i18n): при работе с многоязычным контентом используйте просмотрщик кодовых точек Unicode, чтобы понять, как разные письменности - от латиницы и кириллицы до иероглифов CJK, арабского, деванагари и эмодзи - кодируются и представляются в разных блоках Unicode.
  • Анализ шрифтов и типографики: специалисты по типографике могут анализировать текст символ за символом, чтобы понять, какие кодовые точки Unicode используются, найти невидимые символы, проверить нестандартные пробелы и убедиться в покрытии шрифта по разным блокам Unicode.
  • Очистка и нормализация данных: при очистке наборов данных используйте просмотрщик, чтобы найти символы нулевой ширины, невидимые разделители, управляющие символы и другие невидимые кодовые точки, которые могут вызывать проблемы обработки, сбои сравнения строк или проблемы с хранением.
  • Обучение и образование: студенты и преподаватели могут интерактивно изучать стандарт Unicode: увидеть, как UTF-8 и UTF-16 по-разному кодируют один и тот же символ, понять структуру блоков и категорий Unicode и освоить основы кодирования символов.

Что такое кодовая точка Unicode?

Кодовая точка Unicode - это уникальный номер, присвоенный каждому символу стандарта Unicode. Каждая кодовая точка записывается как U+ и шестнадцатеричное число (например, U+0041 для латинской буквы A, U+4E00 для иероглифа CJK 一 или U+1F600 для эмодзи с улыбающимся лицом 😀). Стандарт Unicode определяет более 149 000 символов в 161 письменности и сотнях блоков, что делает его универсальной системой кодирования символов, используемой практически всем современным ПО и интернетом. Наш просмотрщик кодовых точек Unicode позволяет исследовать каждый символ любого текста, показывая его кодовую точку, официальное название, категорию, блок и байтовые кодировки.

Как пользоваться этим просмотрщиком кодовых точек Unicode

  1. 1. Введите или вставьте текст: введите или вставьте любой текст в поле ввода. Инструмент мгновенно анализирует каждый символ и показывает подробную информацию Unicode о каждой кодовой точке в сортируемой таблице. Символы перебираются по кодовым точкам Unicode, а не по видимым кластерам графем.
  2. 2. Просмотрите сводную статистику: сводные карточки показывают общее число кодовых точек, количество букв, цифр, знаков пунктуации и символов, а также общие размеры в байтах для UTF-8 и UTF-16. Диаграммы распределения по категориям и блокам помогают с первого взгляда понять состав текста.
  3. 3. Фильтруйте, ищите и исследуйте: используйте поле поиска, чтобы найти конкретные символы по названию или кодовой точке. Фильтруйте по категории Unicode (Lu для заглавных, Nd для цифр и т. д.) или по блоку Unicode. Нажмите на любую строку, чтобы развернуть подробную информацию, включая последовательности байтов UTF-8/UTF-16, HTML-сущности и escape-последовательности JSON - всё можно скопировать для своих проектов.

Ключевые понятия Unicode, которые объясняет этот инструмент

  • Кодовые точки и кодовые единицы: кодовая точка (U+0041) - это абстрактный идентификатор символа. Кодовые единицы - это фактические последовательности байтов, которыми символ хранится или передаётся. UTF-8 использует 1-4 байта на кодовую точку, а UTF-16 - 1-2 16-битные единицы (2-4 байта). Символы выше U+FFFF требуют двух кодовых единиц UTF-16 - так называемой суррогатной пары.
  • Категории Unicode: каждая кодовая точка относится к общей категории, обозначаемой двухбуквенным кодом: Lu (заглавная буква), Ll (строчная буква), Nd (десятичное число), Po (прочая пунктуация), Sm (математический символ), Sc (символ валюты) и многим другим. Первая буква указывает основной класс: L (буква), N (число), P (пунктуация), S (символ), Z (разделитель), C (управляющий), M (метка).
  • Блоки Unicode: символы организованы в непрерывные диапазоны, называемые блоками, каждый из которых охватывает письменность или категорию: «Основная латиница», «Кириллица», «Иероглифы CJK», «Эмотиконы», «Математические операторы» и более 250 других. У каждого блока есть название и определённый диапазон кодовых точек.
  • Кодировки UTF-8 и UTF-16: UTF-8 доминирует в интернете и использует последовательности байтов переменной длины (1-4 байта на кодовую точку), совместимые с ASCII. UTF-16 использует 2 или 4 байта на кодовую точку и применяется в строках JavaScript и многих системных API. Инструмент показывает обе кодировки для каждого символа, чтобы вы видели разницу.

Ограничения и особенности кодовых точек Unicode

Хотя наш просмотрщик кодовых точек Unicode даёт подробный анализ отдельных кодовых точек, важно понимать некоторые концепции. Кодовые точки - это не то же самое, что видимые символы: один видимый кластер графем может состоять из нескольких кодовых точек (например, базовая буква с комбинирующими диакритическими знаками или эмодзи с селектором варианта). Инструмент анализирует кодовые точки по отдельности, поэтому комбинирующие последовательности отображаются как отдельные записи. Символы за пределами Основной многоязычной плоскости (BMP), включая большинство эмодзи и многие символы CJK, используют в UTF-16 суррогатные пары, которые показываются как две кодовые единицы. База названий символов охватывает распространённый ASCII, дополнение Latin-1 и популярные символы Unicode: для символов вне этого диапазона в качестве названия показывается кодовая точка. Весь анализ выполняется полностью в браузере - данные не загружаются на серверы.

Часто задаваемые вопросы

Кодовая точка Unicode - это уникальный номер, присвоенный каждому символу стандарта Unicode. Она записывается как U+ и шестнадцатеричное число: например, U+0041 для буквы A, U+00A9 для знака копирайта © или U+1F600 для эмодзи с улыбающимся лицом 😀. Каждая кодовая точка представляет конкретный символ независимо от платформы, программы или языка.

Кодовая точка (например, U+1F600) - это абстрактный идентификатор символа. Кодовая единица - это единица фиксированного размера, используемая конкретной кодировкой: UTF-16 использует 16-битные единицы, поэтому U+1F600 превращается в две единицы (D83D DE00), называемые суррогатной парой. Байт - это фактическое 8-битное значение, хранимое в памяти или передаваемое по сети: UTF-8 кодирует U+1F600 четырьмя байтами (F0 9F 98 80). Наш просмотрщик показывает все три представления.

Категории Unicode (их также называют общими категориями) классифицируют каждую кодовую точку по её основной функции. Основные категории: буква (L), метка (M), число (N), пунктуация (P), символ (S), разделитель (Z) и прочее (C). У каждой есть подкатегории: Lu - заглавная буква, Ll - строчная буква, Nd - десятичное число, Po - прочая пунктуация, Sm - математический символ.

Блоки Unicode - это непрерывные диапазоны кодовых точек, группирующие символы по письменности или теме. Например, «Основная латиница» (U+0000-U+007F) охватывает ASCII, «Кириллица» (U+0400-U+04FF) - русский и родственные письменности, «Иероглифы CJK» (U+4E00-U+9FFF) - китайские символы, а «Эмотиконы» (U+1F600-U+1F64F) - эмодзи-лица.

UTF-8 - это кодировка переменной ширины, использующая от 1 до 4 байт на кодовую точку. Символы ASCII (U+0000-U+007F) занимают 1 байт. Символы до U+07FF - 2 байта, до U+FFFF - 3 байта, выше U+FFFF - 4 байта. UTF-8 доминирует в интернете благодаря совместимости с ASCII и эффективности.

Один видимый символ (кластер графем) может состоять из нескольких кодовых точек Unicode. Типичные примеры: базовая буква с комбинирующими диакритическими знаками, эмодзи с ZWJ-последовательностями (например, семья 👨‍👩‍👧‍👦) и флаги, закодированные парами региональных индикаторов. Наш просмотрщик показывает каждую кодовую точку последовательности отдельно.

Да: 100 % бесплатно навсегда, без регистрации, без рекламы и без ограничений на использование. Весь анализ выполняется полностью в вашем браузере. Текст никогда не загружается на сервер. Вы можете безопасно анализировать любой текст, включая пароли, конфиденциальные документы и материалы исследований безопасности.