Работа с документами в компании распадается на пять операций, и когда говорят «внедрить ИИ для документов», обычно имеют в виду одну из них, не называя какую. Распознать скан и вытащить реквизиты — одна задача. Разложить входящие письма по отделам — другая. Сверить акт с договором — третья. Ответить сотруднику «какой у нас порядок возврата» по внутренним регламентам — четвёртая. Написать черновик ответа — пятая. У них разная механика, разная надёжность и разная цена, и смешивать их в одно техзадание — самый частый способ получить систему, которая делает всё понемногу и ничего до конца.
Ниже все пять операций по отдельности: что делает модель, что делает обычный код, где ошибается, кто проверяет и сколько стоит. Статья — карта темы: по каждой операции есть отдельный разбор, ссылки стоят по ходу.
Пять операций и их надёжность
| Операция | Вход | Что делает модель | Что делает код | Надёжность |
|---|---|---|---|---|
| Извлечение данных | скан, PDF, письмо, фото | читает и заполняет карточку по схеме | проверяет формат, кладёт в учёт черновиком | высокая на типовых документах |
| Сортировка и маршрутизация | поток входящих | определяет тип и адресата | переносит в папку, ставит задачу, уведомляет | высокая, ошибки редки и дёшевы |
| Проверка и сверка | документ плюс правила или второй документ | сравнивает условия, находит расхождения и пропуски | отчёт человеку, блокировка при критичном | средняя: зависит от качества чек-листа |
| Поиск и ответы по базе | вопрос сотрудника или клиента | отвечает по найденным фрагментам со ссылкой | ищет фрагменты в индексе документов | средняя: зависит от подготовки базы |
| Черновики | данные сделки, шаблон, история | собирает текст по шаблону | подставляет данные, отдаёт на правку | высокая как черновик, низкая как финал |
Общее правило для всех пяти: модель читает и формулирует, код проверяет и записывает, человек решает там, где цена ошибки высокая. Модель, которая сама пишет в учётную систему без проверки, — не автоматизация, а генератор ошибок с правами записи.
Извлечение: из скана в карточку
Самая частая задача и самая быстро окупаемая. Счёт от поставщика приходит письмом в PDF, накладная — фотографией с телефона водителя, анкета клиента — сканом. Человек перебивает реквизиты в учёт; модель делает это за секунды.
Файлы модель читает без предварительного распознавания: хранилище GigaChat принимает txt, doc, docx, pdf, epub, ppt, pptx, xlsx и изображения jpeg, png, tiff, bmp (документация по работе с файлами, проверено 8 сентября 2026 года). Скан и фотография — тоже вход, но качество на них ниже, чем на текстовом PDF.
Ключевое слово здесь — схема. Без неё модель вернёт пересказ документа в свободной форме, каждый раз в другом. Со схемой она заполняет карточку с одинаковыми полями: GigaChat умеет отдавать ответ строго по JSON-схеме, если передать список обязательных полей required и параметр strict: true; без этого ответ может содержать поля, которых в схеме нет (генерация структурированных данных, проверено 8 сентября 2026 года).
Где ошибается. Три места, и все предсказуемые: плохие сканы (наклон, тень, низкое разрешение), числа с похожими цифрами (0 и 8, 1 и 7 на факсимильных копиях) и поля, которых в документе нет, — модель склонна их «додумать». Первое лечится требованием к качеству на входе, второе — проверкой кодом (сумма позиций должна сходиться с итогом, ИНН — проходить контрольную сумму), третье — правилом в схеме «если поля нет, вернуть null» и порогом: документ с пустыми обязательными полями идёт человеку.
Как это выглядит для бухгалтерской первички — счета, акты, накладные — разобрано в статье ИИ для бухгалтерии, а для документов, которые заводят в 1С, — в статье про ИИ-агента для 1С.
Сортировка: разложить входящие
Вторая операция проще первой и часто полезнее. В общую почту компании приходит всё подряд: счета, претензии, запросы коммерческих предложений, резюме, спам, письма от налоговой. Человек читает и пересылает. Модель определяет тип и адресата по содержанию, а код переносит письмо в папку, ставит задачу в CRM и уведомляет ответственного.
Ошибки здесь редкие и дешёвые: неверно направленное письмо возвращается через минуту, а не теряется на неделю. Поэтому сортировку можно запускать без подтверждения человеком почти сразу, в отличие от извлечения.
Практическая деталь: набор типов должен быть закрытым и коротким. Десять категорий модель различает уверенно, пятьдесят — начинает путать соседние. Всё, что не попало в категории, идёт в «прочее» к человеку, и по этому «прочему» через месяц видно, какие категории добавить.
Проверка и сверка: против правил, а не против воображения
Третья операция — самая востребованная у юристов и закупщиков и самая зависимая от подготовки. Модель сравнивает документ с чем-то: с чек-листом компании, с шаблоном, с другим документом, с прошлой версией.
Что она делает хорошо: находит расхождения между актом и договором (сумма, сроки, состав работ), между спецификацией и счётом (позиции, количества, цены), между двумя версиями договора (что изменилось по смыслу), между документом и вашими правилами (предоплата больше допустимой, срок оплаты длиннее лимита). Всё это — сопоставление, и модель в нём сильна.
Что она делает плохо: юридическую оценку, ссылки на нормы, суждения о рисках. Модель может процитировать статью закона, которой нет, и сделает это уверенно. Правило простое: модель проверяет документ против вашего чек-листа, а не против законодательства. Чек-лист — это ваша экспертиза, переведённая в правила с порогами, и без него проверка не работает. Подробно с примером структуры чек-листа — в статье ИИ для проверки договоров; про тендерную документацию, где сверка требований с возможностями компании решает, участвовать ли, — в статье ИИ для тендеров и закупок.
- Модель находит десять замечаний общего вида
- Пропускает единственный критичный пункт
- Цитирует нормы по памяти
- Результат каждый раз в другой форме
- Правила с порогами записаны заранее
- Каждое несоответствие — с указанием пункта
- Пропуски по списку обязательных условий
- Отчёт уходит юристу или руководителю
Поиск и ответы по базе документов
Четвёртая операция — та, которую чаще всего называют «обучить нейросеть на наших документах». Обучать ничего не нужно и не стоит: модель не запоминает ваши регламенты, она получает нужные куски в момент вопроса. Механика называется RAG: документы режутся на смысловые фрагменты, индексируются, по вопросу находятся подходящие, и модель отвечает только по ним со ссылкой на источник. Устройство и типовые ошибки разобраны в статье что такое RAG.
Два требования, без которых ответы по базе вредны. Первое: ответ обязан показывать, из какого документа взят. Ответ без источника невозможно проверить, и сотрудник либо перепроверяет всё сам (тогда зачем система), либо верит на слово (тогда рано или поздно ошибка). Второе: модель отвечает только по найденному. Если фрагментов нет, правильный ответ — «в документах этого нет», а не пересказ общих знаний.
Типичные применения: регламенты и инструкции для сотрудников («какой порядок согласования отпуска»), техническая документация для поддержки («как настроить это оборудование»), база знаний для ответов клиентам. Для юридических документов это работает с оговоркой: ответ по договорам компании — да, ответ по законодательству — с проверкой по первоисточнику.
Черновики: экономия времени, а не замена
Пятая операция самая простая по механике и самая опасная по ожиданиям. Модель собирает текст по шаблону и данным: ответ на претензию, коммерческое предложение по параметрам сделки, пояснение к отчёту, письмо контрагенту. Как черновик это экономит время. Как финал — нет: модель уверенно пишет то, чего не знает, и в письме клиенту это дорого.
Правило: черновик всегда на правку человеку, и в интерфейсе это должно быть очевидно — кнопка «отправить» появляется после правки, а не рядом с генерацией. Для договоров правило строже: составление только по шаблону компании, с проверкой по тому же чек-листу, что и входящие.
Что общего у всех пяти: данные и права
Персональные данные и коммерческая тайна есть почти в каждом документе. Отправлять их в сервис, который хранит данные за рубежом или использует для обучения, нельзя — это регулирует закон о персональных данных (152-ФЗ, проверено 8 сентября 2026 года). Рабочих вариантов три: российское облако по договору с юрлицом (GigaChat, Yandex AI Studio), вырезание персональных данных до отправки, модель в контуре компании для самых чувствительных случаев. Что даёт локальная модель и чего стоит, разобрано в статье про локального ИИ-агента.
Права записи. Ни одна из пяти операций не должна писать в учёт, CRM или документооборот без проверки: извлечение создаёт черновик, сортировка переносит письмо (обратимо), сверка формирует отчёт, ответы по базе ничего не пишут, черновики ждут правки. Система, которая читает чужие документы, — цель для инъекций: в PDF можно вставить инструкцию для модели. Пока модель не принимает решений и не пишет сама, инъекция даёт неверный черновик, который заметит человек. Подробно — в разборе атак на ИИ-агентов.
Сколько стоит
Модель. Страница текста — порядка тысячи токенов. У GigaChat для юрлиц Lite стоит 0,065 ₽ за тысячу токенов, Pro — 0,5 ₽, Max — 0,65 ₽, минимальный платёж 600 ₽ в месяц (тарифы, проверено 8 сентября 2026 года). Извлечение реквизитов из счёта на одной странице — копейки, проверка договора на десяти страницах старшей моделью — десятки рублей. На потоке в сотни документов в день это заметно, но считается заранее.
Разработка. Один сценарий — одна операция под один тип документов: схема, правила, интеграция с вашей системой, проверка на архиве. Недели, не месяцы. Готовые платформы документооборота с ИИ внутри стоят от сотен тысяч рублей и имеют смысл, когда операций много и они типовые для отрасли.
Сопровождение. Схемы и чек-листы меняются вместе с бизнесом: новый тип документа, новый контрагент, новое правило. Менять их должен сотрудник, а не разработчик, — это требование к системе, а не пожелание.
С чего начать
- 1Список документов за неделючто приходит, откуда, кто и что с ним делает руками
- 2Разложить на пять операцийизвлечение, сортировка, сверка, поиск, черновики — у каждого документа своя
- 3Одна операция, один тип документасамая массовая и с обратимой ошибкой
- 4Проверка на архиве30–50 прошлых документов: сходится ли результат с тем, что сделали люди
- 5Часть потока и надзорзапуск на доле документов, журнал ошибок, правила дописываются
Компании, которые начали с «внедрить ИИ в документооборот», через полгода имеют платформу и ту же ручную работу. Компании, которые начали с недели наблюдений, обычно обнаруживают, что первый эффект даёт сортировка входящих, второй — извлечение из счетов, и только третий — та сверка, ради которой всё затевалось. Как отбирать процессы по окупаемости, разобрано в статье как автоматизировать бизнес-процессы.
Типовые документы компании: какая операция к каждому
Чтобы не гадать, вот разбор по документам, с которыми приходят чаще всего.
| Документ | Откуда приходит | Операция | Что делает система | Кто проверяет |
|---|---|---|---|---|
| Счёт на оплату | почта, PDF | извлечение | карточка реквизитов, проверка ИНН и суммы, черновик в учёте | бухгалтер |
| Акт, накладная | почта, скан, фото от водителя | извлечение и сверка | карточка плюс сравнение с договором и заказом | бухгалтер по расхождениям |
| Договор от контрагента | почта, документооборот | сверка | чек-лист компании, пропуски, сравнение с шаблоном | юрист по отчёту |
| Претензия | почта, форма на сайте | сортировка и черновик | тип и адресат, выдержка сути, черновик ответа по регламенту | руководитель |
| Заявка или запрос КП | почта, форма, мессенджер | извлечение и сортировка | параметры в CRM, ответ «получили», квалификация | менеджер |
| Резюме | почта, площадки | извлечение | карточка кандидата по требованиям вакансии, отсев по стоп-критериям | рекрутер |
| Письмо ведомства | почта | сортировка | тип, срок ответа, задача ответственному с приоритетом | бухгалтер или юрист |
| Техническое задание | почта, документооборот | извлечение и сверка | список требований, сравнение с возможностями | руководитель проекта |
| Внутренний регламент | папка, база знаний | поиск и ответы | индекс для ответов сотрудникам со ссылкой на документ | автор регламента при обновлении |
| Тендерная документация | площадка | извлечение и сверка | чек-лист требований и сроков, сверка с возможностями | тендерный специалист |
У одного документа может быть две операции подряд: акт сначала извлекается, потом сверяется. Это нормально, и это два разных шага в одном сценарии, а не два сценария. Как устроена работа с резюме, разобрано в статье ИИ для HR; с претензиями и обращениями клиентов — в статье про бота поддержки.
Распознавание: модель или отдельный OCR
Частый вопрос: нужна ли отдельная система распознавания сканов до модели, или модель прочитает сама. Ответ зависит от качества входа и объёма.
Модель читает сама, когда сканы приличного качества и поток умеренный. Хранилище принимает изображения напрямую, и для типовых документов — счета, акты, анкеты — этого хватает. Плюс в том, что нет второй системы, минус — цена: изображение тарифицируется дороже текста, и на большом потоке это заметно.
Отдельный OCR перед моделью нужен, когда сканы плохие (факсы, копии копий, фотографии под углом) или поток большой. OCR превращает изображение в текст с координатами, модель работает уже с текстом — дешевле и точнее на числах. Российские облачные сервисы распознавания есть, и их стоит сравнивать по одному критерию: качество на ваших реальных сканах, а не на демонстрационных.
Проверка кодом обязательна в обоих случаях. Ни модель, ни OCR не гарантируют, что «8» не прочитана как «0». Контрольная сумма ИНН, совпадение суммы позиций с итогом, дата в разумном диапазоне — это три проверки, которые ловят большую часть ошибок распознавания и ничего не стоят.
Правило для выбора: начать с модели без OCR на реальных документах компании, посчитать долю ошибок на критичных полях, и если она выше допустимой — добавить OCR. Не наоборот.
Что делаю я
Делаю каждую из пяти операций как отдельный сценарий: извлечение по схеме с проверкой кодом, сортировку входящих, сверку против чек-листа компании, ответы по базе документов со ссылками на источник, черновики по шаблону — с российской моделью по договору или в контуре и без права записи в ваши системы без проверки. Это часть работы по внедрению ИИ в бизнес: найти, где люди читают одно и то же, и снять чтение, оставив решение.
Техническое задание не нужно. Пришлите три-пять типовых документов и скажите, что с ними делают сейчас, — этого достаточно, чтобы разложить задачу на операции и назвать срок.




