Работа с изображениями и сканами в чате с AI
Теперь наш чат позволяет загружать изображения и сканированные документы, чтобы языковая модель могла их анализировать и отвечать на ваши вопросы.
Какие возможности дает распознавание изображений и сканов в вашей работе:
Задавать вопросы по сканированным документам
Получать данные из документов и приводить их в структурированный вид
Работать с фото материалов судебных дел
Получить анализ графиков
Описывать планы помещений и чертежи
Распознавать схемы и наброски, нарисованные от руки
Читать понятный рукописный текст
Анализировать отчеты и таблицы
Переводить тексты с изображений и сканов на другой язык
Описывать интерфейсы программных продуктов и страниц сайтов
Описывать информацию на изображении
Описывать скриншоты режима рецензирования (небольшие)
Сравнивать сканированные документы (небольшие)
Работать с разнообразной информацией, представленной в визуальном формате
Распознавание визуальных данных происходит при помощи моделей OpenAI и Claude. Специальный OCR движок получает сам текст, а умные модели за счет своих свойств довосстанавливают текст, который распознался некачественно.
Поддерживаемые форматы
| Тип вложения | Поддерживаемые форматы |
| Изображения | JPG, PNG, TIFF, GIF (не анимированный) |
| Сканы |
Общий объем изображений и сканов в одном диалоге ограничен:
- Для моделей OpenAI: до 500 изображений или страниц до 50 МБ;
- Для моделей Claude: до 100 изображений или страниц до 32 МБ.
Как использовать возможности распознавания
Просто приложите один или несколько файлов, опишите задачу и ожидайте ответа модели.
Подробнее:
В списке моделей обратите внимание на строчку «Распознавание файлов».
- "все типы PDF, JPG, PNG, TIFF" — модель умеет видеть картинки и сканы
- "нет" — загружать изображения и сканы в таком чате не получится
Выберите совместимую модель и отправьте сообщение с вложением.
Если выбранная модель не поддерживает визуальный контент, система предупредит вас при попытке отправить сообщение.
Как получить лучшие результаты:
- При загрузке нескольких файлов давайте им понятные имена — они помогают модели ориентироваться, когда вы обращаетесь к разным файлам внутри задачи.
- Используйте файлы с хорошим разрешением, видимым текстом и не размытые визуально
Если файл имеет размер более 5 МБ, Doczilla уведомит о процессе обработки через всплывающее сообщение. После успешной обработки файл отобразится в чате
Особенности работы с PDF-документами
Система по-разному обрабатывает PDF в зависимости от их содержимого:
PDF с текстовым слоем:
- Текст извлекается и обрабатывается как обычный документ
- Не учитывается в лимитах на изображения
- Не ограничен по объему содержимого при том же размере файла (учитывается только общий контекст диалога)
- Возможна работа в режиме обезличивания
PDF без текстового слоя (скан):
- Каждая страница конвертируется в изображение
- Учитывается в лимитах на количество изображений
- Обрабатывается с помощью визуального распознавания
- Работа в режиме обезличивания невозможна
Ограничения при работе с изображениями и сканами
1. Режим обезличивания текста несовместим с визуальным контентом
Анонимайзер не может обезличить текст из файла, пока ему не будет доступен сам текст. А текст можно получить только после обработки моделью.
При попытке использовать анонимайзер в диалоге с визуальным контентом вы увидите предупреждение:
Изображения и сканированные PDF не могут быть обезличены перед отправкой в выбранную модель. Приложите файлы текстового формата или выключите режим обезличивания
2. Документы смешанного типа
- Если документ содержит и копируемый текстовый слой, и изображения (обычно это документы, сконвертированные из docx в PDF), то такой документ обработается по текстовому типу и прочитает только текст.
- Если документ представляет собой скан или фото, на котором есть текст и изображения, то такой документ обработается по визуальному типу и прочитает текст и изображения.
3. Качество разрешения и результаты распознавания
- Старайтесь использовать вложения с хорошим качеством. Это даст наилучший результат.
- Документы, которые выглядят визуально размыто, могут быть распознаны моделью за счет ее интеллектуальных свойств. Визуальный слой обработается OCR-движком, а сама модель дополнительно восстановит фразы с ошибками, полученными при распознавании. Но как и при работе с любым OCR, могут возникать несоответствия с оригиналом.
- Если файлы имеют большой вес, они дополнительно поджимаются по объему и качеству, чтобы их отправка могла быть возможной. Но это может сказаться на качестве в худшую сторону. Пожалуйста, учитывайте этот фактор.
- Если текст слишком мелкий, модели будет сложно качественно его прочитать.
4. В отличие от программ по распознаванию документов, чат не возвращает распознанную и отформатированную копию документа.
Но можно попросить нейросеть распечатать полный текст документа в чат.
Модель не будет делать это по умолчанию, не забывайте давать инструкции, если вам обязательно нужен текст из вложения.
5. Срок хранения изображений и сканов
- Файлы формата JPEG, PNG, TIFF и сканированные PDF будут храниться в диалоге в течение 5 дней
- По истечении этого срока файлы удалятся из диалога, но при этом останутся ответы, которые AI сформулировал на их основе. этого может быть достаточно для дальнейшей работы
- При необходимости можно снова приложить файлы в диалог, чтобы задавать по ним вопросы.
Ограничение не касается текстовых PDF, файлов формата DOCX, XLS, TXT, CSV. Они хранятся постоянно.
6. Прочие ограничения
| Ограничение | Возможное решение |
| Файл слишком большой | Уменьшите размер файла до 50 МБ или разделите на несколько частей |
| Превышен лимит вложений в диалоге | Удалите часть файлов, предварительно попросив модель распечатать их текст. Также можно начать новый диалог |
| Модель не поддерживает изображения |
|
| Модель игнорирует изображения | Проверьте срок хранения файлов (мог истечь 5-дневный период) или качество вложения (изображения в очень плохом разрешении могут не распознаться) |
| Медленная обработка при отправке сообщения | Для больших файлов это нормально, дождитесь завершения обработки |
| Модель долго отвечает после отправки файла |
Модель сначала должна распознать изображения, а потом подготовить ответ. Допускается ответ в пределах 3 минут для объемных вложений |
| Модель некорректно распознала текст | Попробуйте другую модель с поддержкой визуального контента |
Часто задаваемые вопросы
Как проверить, поддерживает ли модель работу с изображениями?
Откройте меню моделей и посмотрите параметр “Распознавание файлов” в описании модели.
Могу ли я изменить срок хранения вложений?
Нет, 5-дневный период хранения фиксирован и его не получится изменить. При необходимости вы можете снова приложить файл к диалогу
Что произойдет с ответами в диалоге после удаления вложений?
Все ответы в диалоге сохранятся. Если ранее в диалог был распечатан текст файла, модель будет его использовать в общей канве диалога. Если ранее полученный текст был недостаточно детален, можно снова приложить файл и продолжить задавать вопросы по содержимому файла.
Могу ли я посмотреть вложенные в диалог файлы в файловой системе Doczilla?
Файлы, которые приложены к диалогу, не сохраняются в файлах Doczilla. Они хранятся только внутри диалога в специальном предобработанном виде для отправки в модель.
Может ли чат генерировать картинки?
Doczilla обеспечивает функционал , предназначенный только для понимания изображений. При работе с чатом модель может интерпретировать и анализировать изображения, но не способна их генерировать, создавать, редактировать, изменять или формировать.
Что делать, если интерпретация изображения кажется неверной?
- Убедитесь, что изображение чёткое, высокого качества и правильно ориентировано.
- Попробуйте использовать разные формулировки запроса для улучшения результата.