Перейти к основному содержимому

Извлечь текст

Скопируйте текст из документа

Ваш файл не покидал браузер.

Перетащите файл сюда

PDF-документ · Не более 100 МБ

Как извлечь текст из PDF?

Текстовый слой документа выгружается в текстовый файл, и каждая страница помечается своим номером. Благодаря этому цитату можно забрать вместе с номером страницы. Инструмент не распознаёт текст: в отсканированном документе текстового слоя нет, и в этом случае он не отдаёт пустой файл, а сообщает, что перед ним скан.

Чего извлечение текста не делает

  • Не распознаёт надписи на отсканированной странице.
  • Не сохраняет структуру таблиц и колонок.
  • Не сохраняет шрифты, полужирное начертание и другое оформление.

Пример: 10 страниц и пометки страниц

Из документа на 10 страниц извлечён текст: получилось 10 блоков страниц и всего 160 знаков. Каждый блок начинается со своего номера страницы, поэтому видно, откуда взят фрагмент. Затем тот же инструмент применён к документу, превращённому в изображения, и текста он не нашёл — вместо результата вернулось сообщение о том, что документ является сканом.

При работе с обзором литературы и цитатами

В обзоре литературы основной труд уходит не на чтение, а на повторный поиск прочитанного: вспомнить, на какой странице какой статьи была фраза, увиденная несколько месяцев назад, тяжело. При этом требования ВАК предписывают указывать при прямой цитате номер страницы, поэтому просто скопировать фразу из текста недостаточно. Этот инструмент помечает каждый блок своим номером страницы, поэтому извлечённый текст, перенесённый в вашу исследовательскую тетрадь, сохраняет адрес цитаты. Особенно это экономит время при работе с длинными статьями из зарубежных журналов. Для отсканированных старых изданий сначала понадобится программа распознавания. Прочитайте извлечённый текст по предложениям: внутри PDF строки привязаны к положению на странице, поэтому в статье с колонками фразы могут перемешаться, и цитату стоит сверить с исходной страницей.

Вопросы об извлечении текста из PDF

Почему из скана не извлёкся текст?

Отсканированная страница является изображением, текстового слоя в ней нет. Инструмент это определяет и вместо пустого файла сообщает о ситуации. Для такого документа нужна программа распознавания; этот инструмент такой работы не выполняет.

Как выходят таблицы?

Ячейки таблицы записываются текстом подряд, структура колонок не сохраняется. Так устроен сам PDF: внутри документа хранятся не ячейки, а фрагменты текста, привязанные к положению на странице.

Как проставляются номера страниц?

Каждый блок начинается со своего порядкового номера, соответствующего положению страницы в документе. Если номер, напечатанный на странице, отличается — например, обложка не пронумерована, — учитывайте эту разницу.

Сохраняется ли форматирование?

Нет. Результат является простым текстом: полужирное начертание, курсив, размер шрифта и уровни заголовков не сохраняются. Это сделано намеренно, потому что цель — чистый текст для цитирования и поиска.

Научная статьяСтатья по требованиям ВАК