Перейти к содержимому
Aback Tools Logo

Конвертер PDF в JSON

Извлеките полную структуру содержимого любого PDF-файла в чистый структурированный JSON. Получайте текстовые элементы с координатами, сгруппированными линиями, размерами страниц и метаданными документа — все это обрабатывается локально в вашем браузере без загрузки на сервер. Выберите один из трех режимов вывода и загрузите или скопируйте результат.

No PDF loaded

Upload a PDF above to extract its content as JSON.

Что такое преобразование PDF в JSON?

Преобразование PDF в JSON преобразует каждую выбранную страницу PDF в файл JSON, который можно открывать, редактировать, совместно использовать или встраивать в любое место, где поддерживаются файлы изображений. Наш конвертер PDF в JSON предназначен для быстрого экспорта страниц без программного обеспечения для настольного конвертера.

Как работает наш конвертер PDF в JSON

Конвертер загружает ваш PDF-файл в браузер, отображает страницы с выбранным разрешением и подготавливает загружаемый вывод в формате JSON. Обработка остается локальной для вашего сеанса, что позволяет избежать загрузки документов в удаленную службу преобразования.

Параметры качества экспорта

Инструменты преобразования PDF в изображение могут предоставлять такие настройки, как разрешение, качество изображения и пакетные загрузки. Более высокие настройки обеспечивают более четкое изображение для печати и подробного просмотра, а более низкие настройки создают файлы меньшего размера для быстрого обмена.

Структура выходного файла JSON

Каждый экспортированный файл представляет собой обработанную страницу PDF в виде отдельного изображения JSON. Это делает результат полезным для миниатюр, предварительного просмотра, снимков экрана, визуального обзора, повторного использования контента и систем, которые не принимают полную загрузку PDF-файлов.

Как открыть файлы JSON. Файлы JSON можно открывать на вкладках браузера, в средствах просмотра изображений, в инструментах дизайна, в потоках загрузки CMS, при предварительном просмотре операционной системы и во многих рабочих процессах с документами. Используйте экспорт ZIP, если вам нужны все страницы вместе за одну загрузку.

Часто задаваемые вопросы

Инструмент извлекает полную структуру содержимого вашего PDF-файла в документ JSON. В структурированном режиме это включает в себя: метаданные документа (название, автор, даты), размеры каждой страницы, отдельные текстовые элементы с координатами X/Y и размерами шрифта, сгруппированные текстовые строки и расшифровку обычного текста. Компактные режимы выводят только строки или только текст.

«Структурированный» обеспечивает максимальную детализацию — метаданные, элементы на странице с координатами, сгруппированные строки и текст. «Только строки» более компактен: на странице выводятся текстовые строки, сгруппированные по Y. «Только текст» — самый минимальный вариант, предоставляющий только текстовую строку на странице. Используйте Structured для разработчиков, которым нужны точные данные макета, и Text для простого извлечения контента.

Да. Используйте поле «Диапазон страниц», чтобы указать, какие страницы следует извлечь. Введите «все» для каждой страницы, один номер страницы, например «3», страницы, разделенные запятыми, например «1,3,7», или диапазоны, например «2–5». Вы можете комбинировать их: «1,3-5,8» — выдержки из страниц 1, 3, 4, 5 и 8.

Нет. Все извлечение выполняется полностью в вашем веб-браузере с использованием клиентского JavaScript (pdfjs-dist). Ваш PDF-файл никогда не загружается и не передается на какой-либо сервер.

При включении в структурированном режиме каждый текстовый элемент в выходных данных JSON включает свою позицию X и Y на странице (в точках от нижнего левого начала координат), а также ширину, высоту и размер шрифта. Это полезно для точного анализа макета, обнаружения ограничительной рамки или программного копирования макета PDF.

Да. В настройках формата JSON выберите отступ в 2 пробела (по умолчанию), отступ в 4 пробела или минимизированный (без пробелов). Минимизированный вывод идеально подходит для программного потребления; вывод с отступом легче просматривать человеком.

Лишь частично — инструмент извлекает встроенный цифровой текст. Если PDF-файл представляет собой отсканированное изображение, его страницы появятся в выводе с пустыми массивами элементов и без текста. Сначала запустите PDF-файл с помощью инструмента OCR, чтобы сгенерировать встроенный текст, а затем преобразуйте его в JSON.