Очистка текста из PDF
Вставьте текст, скопированный из PDF, и сразу получите чистый читаемый текст. Инструмент исправляет переносы на конце строк, жёсткие переносы абзацев, двойные пробелы, лигатуры (fi→fi, fl→fl) и невидимые Unicode-артефакты. Десять настраиваемых правил очистки — включите нужные для вашего документа. Бесплатно, приватно и без регистрации.
Cleaning Rules
Почему текст из PDF получается таким грязным
PDF не хранит абзацы и предложения — он хранит глифы с точными координатами на странице. При копировании просмотрщик пытается восстановить порядок чтения и по ходу дела обрывает текст в конце каждой визуальной строки и ставит дефисы для переноса слов.
Отсюда типичные симптомы: абзацы, искрошенные на множество строк, слова, разорванные пополам, типографские лигатуры и невидимые пробелы, из-за которых поиск не находит нужное.
Десять правил и их назначение
Каждое правило включается отдельно, поэтому очистку можно подстроить под конкретный документ.
- Восстановить мягкий перенос и склеить разделённые слова.
- Объединить жёсткие переносы, чтобы собрать абзацы заново.
- Объединить двойные пробелы и убрать пробелы в конце строк.
- Исправить лигатуры (fi→fi, fl→fl) и выпрямить типографские кавычки.
- Нормализовать маркеры, объединить пустые строки и заменить неразрывные пробелы.
- Удалить невидимые символы и символы нулевой ширины, ломающие поиск и сравнение.
Приватность: всё происходит в вашем браузере
Очистка выполняется на JavaScript на вашем устройстве. Сетевых запросов нет, ничего не сохраняется и ни один символ не уходит на сервер.
Можно обрабатывать конфиденциальные документы и работать без интернета: инструмент функционирует офлайн.
Часто задаваемые вопросы
Инструмент убирает артефакты оформления, возникающие при копировании текста из PDF: переносы на конце строк, жёсткие переносы абзацев, двойные пробелы, лигатуры и невидимые Unicode-символы. Обработка идёт сразу в браузере с десятью настраиваемыми правилами.
PDF хранит текст не как сплошной поток, а как глифы с координатами. При копировании просмотрщик восстанавливает порядок чтения по позициям глифов, из-за чего появляются переносы в конце каждой визуальной строки, разрывы слов и лигатуры.
Лигатуры — это составные глифы (fi, fl, ff, ffi, ffl), хранящиеся в шрифтах PDF как один символ Unicode. При копировании они выглядят как отдельные символы, неуместные в обычном тексте. Инструмент заменяет их правильными ASCII-эквивалентами.
Многие PDF разбивают текст по фиксированной ширине колонки. При копировании каждая визуальная строка становится отдельной строкой и разрушает абзацы. Правило распознаёт разбитые строки и соединяет их в непрерывные абзацы, сохраняя разделение пустыми строками.
Да, полностью. Вся очистка выполняется локально в вашем браузере. Текст никогда не покидает устройство и не отправляется на сервер.
Да, 100 % бесплатно. Без регистрации, премиум-тарифа, ограничений по размеру и лимитов использования. Работает целиком в вашем браузере.
Да. Нажмите кнопку загрузки в поле ввода, чтобы открыть .txt с текстом из PDF. Очищенный результат также можно скачать в виде .txt.
Эвристика сохраняет пустые строки и не объединяет строки, заканчивающиеся знаком конца предложения. Для текстов с намеренно короткими строками (поэзия, код) отключите правило «объединить жёсткие переносы».
Это невидимые символы Unicode, встречающиеся в тексте PDF и мешающие поиску, сравнению и обработке естественного языка. Инструмент удаляет распространённые невидимые символы и символы нулевой ширины.