Извлечение текста из PDF
Извлеките весь текст из PDF, просмотрите его, скопируйте или скачайте как файл .txt. Ничего не загружается, всё происходит на вашем устройстве.
Нажмите, чтобы выбрать PDF-файл, или перетащите его сюда
Остаётся на вашем устройстве, ничего не загружается.
Загружаются ли мои PDF-файлы куда-либо?
Нет. Текст извлекается полностью в вашем браузере с помощью JavaScript. Ваши файлы никогда не покидают устройство и не попадают на сервер.
Сработает ли это на сканированном PDF?
Нет, само по себе не сработает. Инструмент читает текст, уже встроенный в PDF, а сканированная страница - это просто изображение, поэтому извлекать нечего, если только к ней уже не применялось распознавание текста (OCR).
Сохраняется ли форматирование вроде колонок или таблиц?
В основном да, но сложные макеты (страницы с несколькими колонками, таблицы) могут выйти в неожиданном порядке чтения, поскольку PDF не хранит текст в строгой структуре сверху вниз.
Могу ли я извлечь текст из PDF, защищённого паролем?
Пока нет. Инструмент не может прочитать PDF, защищённый паролем или зашифрованный, и покажет ошибку. Сначала снимите пароль с помощью программы для чтения PDF.
Из блога: Почему сжатие PDF отлично работает на сканах и почти не работает на отчётах
Как это работает
PDF не хранит абзацы, предложения или даже слова; он хранит потоки глифов символов с заданными позициями: «поместить эту форму символа в эти координаты этим шрифтом». Этот инструмент использует pdf.js, движок PDF от Firefox, чтобы пройти по потоку содержимого каждой страницы и собрать каждую операцию рендеринга текста через getTextContent(). Эти фрагменты соединяются пробелами, а лишние пробелы схлопываются, страница за страницей, формируя обычный текст, который вы видите.
Эта модель хранения объясняет две вещи, которые могут вас удивить при извлечении. Первая — порядок чтения: pdf.js возвращает фрагменты примерно в том порядке, в каком они расположены в файле, а это не всегда тот порядок, в котором человек читает многоколоночную страницу или таблицу. Вторая, и более важная: в отсканированном PDF вообще нет текста; сканер создаёт фотографическое изображение страницы, поэтому, если только кто-то не прогнал его через OCR, там просто нет глифов символов для извлечения, и инструмент честно сообщит, что ничего не нашёл.
Извлечение происходит в момент, когда вы бросаете файл, полностью в локальном воркере. Откройте инструменты разработчика и понаблюдайте за вкладкой «Сеть»: будь то договор или медицинский отчёт, ни один запрос никогда не передаёт ваш документ или его текст куда-либо.