Перейти к содержимому
norito
Изображения
Сжатие изображенияУменьшает до целевого размера файла
Генератор заполнителейИзображения-заполнители на заказ
Удаление фонаВырезает человека с фотографии
Изменить размер изображенияИзменение ширины и высоты, точно или в процентах
Конвертер изображенийКонвертация между JPG, PNG и WebP
Обрезать изображениеПеретащите рамку для обрезки, свободно или с фиксированной пропорцией
Удаление метаданныхУдаляет EXIF, GPS и данные камеры
Водяной знак на изображенииДобавляет текстовый водяной знак с живым предпросмотром
Разработка
Генератор тестовых файловФайлы-заполнители точного размера
Форматирование JSONФорматирует, проверяет и минифицирует
Редактор MarkdownПредпросмотр в реальном времени, экспорт в .md/.html
Генератор UUIDМассовая генерация случайных UUID v4
Кодирование / декодирование Base64Текст в Base64 и обратно, безопасно для UTF-8
Генератор хешейMD5, SHA-1, SHA-256, SHA-512
Конвертер меток времениИз времени Unix в дату и обратно
JSON DiffСравнение двух документов JSON
Декодер JWTДекодирует заголовок и полезную нагрузку JWT
Тестер регулярных выраженийТестирует regex с подсветкой совпадений в реальном времени
CSV в JSONКонвертирует файл CSV в JSON
Просмотр CSVПросмотр и редактирование CSV в виде таблицы
Кодировщик / декодировщик URLПроцентное кодирование или декодирование URL
Кодировщик / декодировщик HTML-сущностейЭкранирует или снимает экранирование HTML-сущностей
Конвертер YAML в JSONКонвертация YAML и JSON в обе стороны
Парсер cron-выраженийОбъясняет расписание cron, показывает следующие запуски
Конвертер систем счисленияДвоичная, восьмеричная, десятичная, шестнадцатеричная и другие
Сравнение текстаПострочное сравнение двух текстов
Текст
Генератор SEO-слаговЧистые URL из заголовков
Генератор текста заданной длиныТекст-заполнитель точной длины
Счётчик словПодсчёт слов, предложений и абзацев в реальном времени
Счётчик символовПодсчёт символов с учётом лимитов платформ
Удаление дублирующихся строкУдаляет повторяющиеся строки из списка
Сортировка строкСортировка по алфавиту, числам или вперемешку
Конвертер регистраUPPERCASE, camelCase, snake_case и другие
Генератор Lorem IpsumТекст-заполнитель по словам, предложениям или абзацам
Поиск и заменаПоиск и замена текста, поддержка regex
Утилиты
Генератор паролейСлучайные пароли и фразы
Генератор QR-кодовПользовательские цвета, коррекция ошибок
PDF
Объединить PDFОбъедините несколько PDF в один
Разделить PDFИзвлеките страницы или разделите на файлы
Повернуть PDFИсправьте развёрнутые или перевёрнутые страницы
PDF в JPG/PNGПревратите страницы в изображения
JPG/PNG в PDFОбъедините изображения в один PDF
Удалить и переставитьУдалите или переставьте страницы
Номера страницПронумеруйте каждую страницу
Водяной знакНанесите текст на каждую страницу
Извлечь текстИзвлеките текст из PDF
Сжать PDFУменьшите размер PDF-файла
Подписать PDFНарисуйте или введите подпись
SEO
Генератор мета-теговЗаголовок, описание, теги OG и Twitter
Конструктор UTMСоздавайте ссылки с UTM-метками
Генератор robots.txtПравила allow/disallow, ссылка на sitemap
Генератор SitemapURL на входе, sitemap.xml на выходе
Design
Градиент CSSЛинейный или радиальный, копируйте CSS
Тень box-shadowОдиночные или многослойные тени
Border-radiusРадиус по каждому углу, копируйте CSS
Генератор faviconВсе нужные размеры favicon
Извлечение палитрыИзвлеките основные цвета из изображения
Проверка контрастаКонтраст WCAG, соответствие AA/AAA
Конвертер цветаHEX, RGB, HSL, CMYK, в реальном времени
Blog

norito / Блог / Почему сжатие PDF отлично работает на сканах и почти не работает на отчётах

Почему сжатие PDF отлично работает на сканах и почти не работает на отчётах

Автор: Shubham Singh · 20 июля 2026 г.

Опубликовано 2026-07-20

Пропустите два разных PDF через один и тот же компрессор — и результаты могут оказаться совершенно разными: отсканированный договор на 40 МБ уменьшается до 3 МБ, а годовой отчёт на 8 МБ упрямо отказывается терять больше нескольких процентов. Ни тот, ни другой результат не означает, что инструмент сломан. Разница в том, из чего на самом деле состоят эти два файла.

PDF — это контейнер, а не один тип файла

Страница PDF может содержать два принципиально разных типа контента. Первый — векторный контент: текст, хранящийся в виде инструкций рисования («поместить глиф буквы A из этого встроенного шрифта в этих координатах, размер 11»), плюс линии, фигуры и заливки, описанные математически. Второй — растровый контент: реальные изображения, встроенные как потоки данных в стиле JPEG или PNG внутри файла. Почти любой вопрос о сжатии PDF сводится к соотношению между этими двумя типами.

Страница чистого текста удивительно мала. Инструкции рисования для плотной страницы договора обычно весят от 2 до 10 КБ после сжатия, а встроенные шрифты используются совместно для всего документа — обычно в сумме несколько десятков КБ. Отсканированная страница, напротив, вообще не содержит текста с точки зрения формата файла. Это одна большая фотография листа бумаги.

Почему PDF с большим количеством текста почти не сжимаются

Текст и векторный контент внутри PDF уже сжаты алгоритмом Flate — тем же, что используется в ZIP-файлах. Сжатие уже сжатых данных почти ничего не даёт; это математическое свойство, а не ограничение программного обеспечения. Поэтому когда компрессор обрабатывает 200-страничный чисто текстовый документ весом 1.5 МБ, около 7 КБ на страницу, попросту не так много «жира» можно срезать. Реальный выигрыш достигается за счёт наведения порядка: удаления неиспользуемых объектов, дедупликации повторяющихся ресурсов и создания подмножеств для полностью встроенных шрифтов. На чистом текстовом документе ожидайте 5–15 процентов, иногда меньше.

Отнеситесь с подозрением к любому инструменту, который обещает сокращение на 70 процентов для чисто текстового PDF. Обычный трюк — растеризация: превращение каждой страницы в одно сжатое изображение. Файл действительно становится меньше, но текст становится размытым при сильном увеличении, его больше нельзя выделить или найти поиском, а программы чтения с экрана перестают работать. Это преобразование, а не сжатие, и для отчёта это почти никогда не то, что вам нужно.

Почему сканы сжимаются так значительно

Стандартное сканирование страницы A4 с разрешением 300 DPI даёт около 2480 на 3508 пикселей, примерно 8.7 миллиона пикселей на страницу. Программное обеспечение сканеров обычно консервативно: сохраняет с высоким качеством JPEG или даже без потерь, что даёт от 2 до 8 МБ на страницу. Это даёт компрессору два мощных рычага.

Первый — понижение разрешения (даунсэмплинг). Переход с 300 DPI на 150 DPI сокращает количество пикселей в четыре раза, а для чтения с экрана разница едва заметна. Второй — перекодирование с более сильным сжатием JPEG: переход от качества 90 к качеству 60 может снова уменьшить размер вдвое лишь с умеренными видимыми изменениями на сфотографированном документе. Объедините оба рычага — и сокращение на 80–95 процентов становится обычным делом. Это ровно та же физика, что и при сжатии фотографии, которую мы подробно рассмотрели в нашем руководстве по сжатию изображений.

Промежуточные файлы

Большинство реальных документов находится между крайностями: отчёты с диаграммами и фотографиями, экспорт слайд-презентаций, брошюры. Вот неочевидный момент: даже в документе, который выглядит преимущественно текстовым, изображения обычно доминируют в общем объёме байтов. Отчёт на 12 МБ с десятью встроенными фотографиями может состоять из 11 МБ фотографий и 1 МБ всего остального, поэтому сжатие может воздействовать только на долю фотографий. Есть и классические паттерны раздувания файлов, о которых стоит знать: некоторые генераторы документов встраивают одно и то же изображение логотипа отдельно на каждой странице вместо однократной ссылки на него, а некоторые встраивают целые семейства шрифтов там, где хватило бы подмножества из 40 символов. Хороший компрессор незаметно исправляет и то, и другое.

Экспорт презентаций заслуживает особого упоминания. Слайды, экспортированные в PDF, часто несут фоновое изображение полного разрешения на каждой отдельной странице, плюс фотографии, размещённые с разрешением, намного превышающим то, что вообще способен показать любой проектор. Именно так презентация из 40 слайдов превращается в PDF на 100 МБ, и именно поэтому презентации — одни из самых благодарных файлов для сжатия: тот же даунсэмплинг, который почти не затрагивает текстовый отчёт, может уменьшить презентацию на 90 процентов, и никто на совещании этого не заметит.

Как предсказать результат до начала

Разделите размер файла на количество страниц. Меньше 50 КБ на страницу — перед вами преимущественно текст, и стоит ожидать однозначного процентного выигрыша. От 100 до 300 КБ на страницу обычно означает смешанный контент, где реалистичны 30–60 процентов. Больше 800 КБ на страницу почти всегда означает скан или документ, насыщенный фотографиями, и здесь возможны 80–95 процентов.

Не уверены, реальный ли это текстовый документ или скан? Попробуйте выделить текст в вашей программе просмотра. Или пропустите его через инструмент извлечения текста: если ничего не выходит, каждая страница — это изображение.

Честные ограничения

Сжатие с потерями накапливается. Скан, сжатый с качеством 60, а затем сжатый ещё раз кем-то другим позднее, быстро деградирует, поэтому сохраняйте оригинал. Скан с пониженным разрешением также является худшим исходником для OCR и повторной печати; если документу может понадобиться то или другое позже, архивируйте версию полного разрешения, а делитесь сжатой. А если PDF огромен из-за двух-трёх конкретных фотографий, иногда чище сначала уменьшить эти изображения с помощью компрессора изображений и пересобрать документ из исправленных версий.

В рамках этих ограничений сжатие — одно из самых эффективных действий, которые можно предпринять с отсканированным документом. Это занимает секунды, и получатель вашего вложения на 3 МБ никогда не узнает, что оно раньше весило 40.

Последнее предостережение перед сжатием чего-либо конфиденциального: проверьте, как на самом деле работает используемый вами инструмент. Многие популярные компрессоры PDF загружают ваш документ на свои серверы для обработки, а отсканированный договор или удостоверение личности — это как раз тот тип файла, который вы, возможно, не хотели бы держать на чужой инфраструктуре, даже недолго. Мы написали отдельное руководство о том, как проверить это самостоятельно. Компрессор norito работает полностью в вашем браузере, так что проверять нечего.

Попробуйте сами: Сжать PDF уменьшает отсканированные и насыщенные изображениями PDF прямо в вашем браузере. Ничего не загружается.
norito

Маленькие утилиты, каждая из которых решает одну надоедливую задачу. Всё работает в вашем браузере, ничего не загружается на сервер.

Продукт

Все инструменты Список изменений Как это работает Блог Сравнение О norito Контакты Политика конфиденциальности Условия использования

PDF

Объединить PDF Разделить PDF Повернуть PDF PDF в JPG/PNG JPG/PNG в PDF Удалить и переставить Номера страниц Водяной знак Извлечь текст Сжать PDF Подписать PDF Сравнение PDF

Изображения

Сжатие изображения Изменить размер изображения Конвертер изображений Обрезать изображение Удаление метаданных Водяной знак на изображении Генератор заполнителей Удаление фона Конвертер AVIF Конвертер HEIC Размеры изображения Аннотатор скриншотов Обрезка для соцсетей

Разработка

Генератор тестовых файлов Форматирование JSON Редактор Markdown Генератор UUID Base64 Генератор хешей Timestamp JSON Diff Декодер JWT Тестер регулярных выражений CSV в JSON Просмотр CSV URL Encoder HTML Entities YAML to JSON Cron Parser Base Converter Сравнение текста Специфичность CSS CSS-переменные Генератор .gitignore JSON Schema Оптимизатор SVG SVG-спрайты SVG в React Парсер URL Парсер User-Agent

Текст

Генератор SEO-слагов Генератор текста заданной длины Счётчик слов Счётчик символов Dedupe Lines Сортировка строк Конвертер регистра Lorem Ipsum Find & Replace Невидимые символы Форматировщик MD-таблиц Генератор MD-таблиц

Утилиты

Генератор паролей Генератор QR-кодов

SEO

Генератор мета-тегов Конструктор UTM Генератор robots.txt Генератор Sitemap Canonical-тег Теги hreflang

Design

Градиент CSS Тень box-shadow Border-radius Генератор favicon Извлечение палитры Проверка контраста Конвертер цвета SVG-блобы CSS clamp() CSS-плавность CSS-фильтры Шумовая текстура CSS-паттерны Тени Tailwind
© 2026 norito. Все инструменты работают локально в вашем браузере. Список изменений Блог Сравнение Как это работает Политика конфиденциальности Условия использования Угости меня кофе
Esc