Работа с изображениями и сканами

Работа с изображениями и сканами в чате с AI

Теперь наш чат позволяет загружать изображения и сканированные документы, чтобы языковая модель могла их анализировать и отвечать на ваши вопросы.

Какие возможности дает распознавание изображений и сканов в вашей работе:

  • Задавать вопросы по сканированным документам

  • Получать данные из документов и приводить их в структурированный вид

  • Работать с фото материалов судебных дел

  • Получить анализ графиков

  • Описывать планы помещений и чертежи

  • Распознавать схемы и наброски, нарисованные от руки

  • Читать понятный рукописный текст

  • Анализировать отчеты и таблицы

  • Переводить тексты с изображений и сканов на другой язык

  • Описывать интерфейсы программных продуктов и страниц сайтов

  • Описывать информацию на изображении

  • Описывать скриншоты режима рецензирования (небольшие)

  • Сравнивать сканированные документы (небольшие)

  • Работать с разнообразной информацией, представленной в визуальном формате

Распознавание визуальных данных происходит при помощи моделей OpenAI и Claude.  Специальный OCR движок получает сам текст, а умные модели за счет своих свойств довосстанавливают текст, который распознался некачественно.

Поддерживаемые форматы

Тип вложения Поддерживаемые форматы
Изображения JPG, PNG, TIFF, GIF (не анимированный)
Сканы PDF

Общий объем изображений и сканов в одном диалоге ограничен:

  • Для моделей OpenAI: до 500 изображений или страниц до 50 МБ;
  • Для моделей Claude: до 100 изображений или страниц до 32 МБ.

Как использовать возможности распознавания

Просто приложите один или несколько файлов, опишите задачу и ожидайте ответа модели.

Подробнее:

В списке моделей обратите внимание на строчку «Распознавание файлов».

- "все типы PDF, JPG, PNG, TIFF" — модель умеет видеть картинки и сканы

- "нет" — загружать изображения и сканы в таком чате не получится

Выберите совместимую модель и отправьте сообщение с вложением.

Если выбранная модель не поддерживает визуальный контент, система предупредит вас при попытке отправить сообщение.

Как получить лучшие результаты:

  • При загрузке нескольких файлов давайте им понятные имена — они помогают модели ориентироваться, когда вы обращаетесь к разным файлам внутри задачи.
  • Используйте файлы с хорошим разрешением, видимым текстом и не размытые визуально

Если файл имеет размер более 5 МБ, Doczilla уведомит о процессе обработки через всплывающее сообщение. После успешной обработки файл отобразится в чате

Особенности работы с PDF-документами

Система по-разному обрабатывает PDF в зависимости от их содержимого:

PDF с текстовым слоем:

  • Текст извлекается и обрабатывается как обычный документ
  • Не учитывается в лимитах на изображения
  • Не ограничен по объему содержимого при том же размере файла (учитывается только общий контекст диалога)
  • Возможна работа в режиме обезличивания

PDF без текстового слоя (скан):

  • Каждая страница конвертируется в изображение
  • Учитывается в лимитах на количество изображений
  • Обрабатывается с помощью визуального распознавания
  • Работа в режиме обезличивания невозможна

Ограничения при работе с изображениями и сканами

1. Режим обезличивания текста несовместим с визуальным контентом

Анонимайзер не может обезличить текст из файла, пока ему не будет доступен сам текст. А текст можно получить только после обработки моделью. 

При попытке использовать анонимайзер в диалоге с визуальным контентом вы увидите предупреждение:

Изображения и сканированные PDF не могут быть обезличены перед отправкой в выбранную модель. Приложите файлы текстового формата или выключите режим обезличивания

2. Документы смешанного типа

  • Если документ содержит и копируемый текстовый слой, и изображения (обычно это документы, сконвертированные из docx в  PDF), то такой документ обработается по текстовому типу и прочитает только текст.
  • Если документ представляет собой скан или фото, на котором есть текст и изображения, то такой документ обработается по визуальному типу и прочитает текст и изображения.

3. Качество разрешения и результаты распознавания

  • Старайтесь использовать вложения с хорошим качеством. Это даст наилучший результат.
  • Документы, которые выглядят визуально размыто, могут быть распознаны моделью за счет ее интеллектуальных свойств. Визуальный слой обработается OCR-движком, а сама модель дополнительно восстановит фразы с ошибками, полученными при распознавании. Но как и при работе с любым OCR, могут возникать несоответствия с оригиналом. 
  • Если файлы имеют большой вес, они дополнительно поджимаются по объему и качеству, чтобы их отправка могла быть возможной. Но это может сказаться на качестве в худшую сторону. Пожалуйста, учитывайте этот фактор.
  • Если текст слишком мелкий, модели будет сложно качественно его прочитать.

4. В отличие от программ по распознаванию документов, чат не возвращает распознанную и отформатированную копию документа.

Но можно попросить нейросеть распечатать полный текст документа в чат.

Модель не будет делать это по умолчанию, не забывайте давать инструкции, если вам обязательно нужен текст из вложения.

5. Срок хранения изображений и сканов

  • Файлы формата JPEG, PNG, TIFF и сканированные PDF будут храниться в диалоге в течение 5 дней
  • По истечении этого срока файлы удалятся из диалога, но при этом останутся ответы, которые AI сформулировал на их основе. этого может быть достаточно для дальнейшей работы
  • При необходимости можно снова приложить файлы в диалог, чтобы задавать по ним вопросы.

Ограничение не касается текстовых PDF, файлов формата DOCX, XLS, TXT, CSV. Они хранятся постоянно.

6. Прочие ограничения

Ограничение Возможное решение
Файл слишком большой Уменьшите размер файла до 50 МБ или разделите на несколько частей
Превышен лимит вложений в диалоге Удалите часть файлов, предварительно попросив модель распечатать их текст. Также можно начать новый диалог
Модель не поддерживает изображения
  • Выберите модель с поддержкой визуального контента или самостоятельно распознайте вложение другими средствами
  • Если вы уже вели диалог с изображением и хотите сменить ранее использованную модель на модель без поддержки визуального контента, можно удалить вложение или начать новый диалог
Модель игнорирует изображения Проверьте срок хранения файлов (мог истечь 5-дневный период) или качество вложения (изображения в очень плохом разрешении могут не распознаться)
Медленная обработка при отправке сообщения Для больших файлов это нормально, дождитесь завершения обработки
Модель долго отвечает после отправки файла

Модель сначала должна распознать изображения, а потом подготовить ответ.

Допускается ответ в пределах 3 минут для объемных вложений

Модель некорректно распознала текст Попробуйте другую модель с поддержкой визуального контента

Часто задаваемые вопросы

Как проверить, поддерживает ли модель работу с изображениями?

Откройте меню моделей и посмотрите параметр “Распознавание файлов” в описании модели.

Могу ли я изменить срок хранения вложений?

Нет, 5-дневный период хранения фиксирован и его не получится изменить. При необходимости вы можете снова приложить файл к диалогу

Что произойдет с ответами в диалоге после удаления вложений?

Все ответы в диалоге сохранятся. Если ранее в диалог был распечатан текст файла, модель будет его использовать в общей канве диалога. Если ранее полученный текст был недостаточно детален, можно снова приложить файл и продолжить задавать вопросы по содержимому файла.

Могу ли я посмотреть вложенные в диалог файлы в файловой системе Doczilla?

Файлы, которые приложены к диалогу, не сохраняются в файлах Doczilla. Они хранятся только внутри диалога в специальном предобработанном виде для отправки в модель.  

Может ли чат генерировать картинки?

Doczilla обеспечивает функционал , предназначенный только для понимания изображений. При работе с чатом модель может интерпретировать и анализировать изображения, но не способна их генерировать, создавать, редактировать, изменять или формировать.

Что делать, если интерпретация изображения кажется неверной?

  • Убедитесь, что изображение чёткое, высокого качества и правильно ориентировано.
  • Попробуйте использовать разные формулировки запроса для улучшения результата.