Автоматизация проверки аудиторских документов для консалтинговой компании на базе ГигаЧат

«Перспектива» — консалтинговая компания, которая помогает организациям готовиться к аудиторским проверкам: анализирует документацию, сверяет ее с требованиями чек-листов и выявляет несоответствия. Для этого специалисты анализируют большие пакеты документов, сверяют их с чек-листами, проверяют соблюдение регламентов и выявляют расхождения между документами. До автоматизации проверка одного аудита выполнялась вручную и занимала несколько часов.
Чтобы быстро проверить возможность автоматизации этого процесса и уложиться в бюджет проекта, мы разработали AI-сервис для анализа аудиторских документов. Первый MVP был создан с использованием AI-assisted разработки, а затем дополнен инженерной логикой для стабильной работы с реальными документами.
Задача
Заказчик обратился в ASAP с идеей автоматизировать проверку аудиторской документации. Необходимо было создать решение, которое смогло бы анализировать пакет документов, сопоставлять данные между ними и формировать результаты проверки по аудиторскому чек-листу. Дополнительным требованием заказчика было использование российской языковой модели для анализа документов.
Архитектура решения
В результате был создан веб-сервис на Python. Пользователь загружает в систему три группы данных: аудиторский чек-лист с критериями проверки, основной документ и дополнительные материалы.
После загрузки система извлекает данные из файлов, передает их на анализ AI, выполняет дополнительные проверки и формирует итоговый результат по каждому пункту чек-листа.
Архитектура решения построена по принципу разделения ответственности между компонентами.
Для анализа документов используется GigaChat — выбор российской языковой модели был одним из требований заказчика. Модель отвечает за работу с содержанием документов: поиск необходимой информации, анализ данных и формирование результатов проверки по пунктам чек-листа.
Разработка самого сервиса велась с использованием Claude как инструмента AI-assisted разработки. Он помогал ускорить реализацию программной логики, создание компонентов системы и проверку технических решений. При этом архитектура системы, бизнес-логика и ключевые инженерные решения оставались зоной ответственности команды ASAP.
Такой подход позволил использовать российскую языковую модель там, где это требовал заказчик, сохранив высокую скорость разработки благодаря AI-assisted подходу.
Автоматизация проверки документов с помощью AI
На первый взгляд задача выглядела достаточно простой: загрузить комплект документов в языковую модель, передать ей аудиторский чек-лист и получить результат проверки по каждому пункту.
Однако уже на этапе разработки первой версии стало понятно, что основная инженерная задача заключается не в подключении AI, а в создании системы, которая сможет использовать результаты модели в автоматическом процессе аудита.
Один аудит может включать несколько десятков документов разных форматов: Word, Excel, PDF, шаблоны с макросами и сканы. При этом системе недостаточно найти отдельные фрагменты текста — необходимо сопоставить данные между документами, проверить их соответствие и сформировать единый результат по каждому пункту чек-листа.
Еще одной особенностью стала необходимость работы с большим объемом документов. Передать весь комплект файлов одним запросом к модели было невозможно, поэтому документы обрабатывались отдельно с учетом их структуры и назначения. После этого результаты отдельных проверок объединялись на уровне приложения.
Кроме анализа содержания документов, системе требовалось получать результаты в формате, пригодном для дальнейшей автоматической обработки.
Поэтому вокруг AI-модели был построен дополнительный слой обработки. Внутри процесс разделен на несколько этапов:
- извлечение данных из документов;
- анализ содержания с помощью GigaChat;
- дополнительные проверки, реализованные в программном коде;
- объединение результатов и формирование итогового отчета.
В результате решение представляет собой не AI-чат с загруженными файлами, а полноценное решение для автоматического аудита. GigaChat отвечает за анализ содержания документов и поиск необходимой информации, а система вокруг него обеспечивает управляемость и надежность процесса.
AI-assisted разработка системы
Claude использовался не для анализа документов, а как инструмент разработки самого сервиса.
Сначала в Claude разрабатывалась логика будущей системы: как пользователь будет загружать чек-лист, основной документ и дополнительные материалы, каким образом система должна находить необходимые сведения, проверять их по требованиям и формировать статус по каждому пункту.
После этого разработанная структура переносилась в проект и адаптировалась для взаимодействия с GigaChat. В итоговой архитектуре роли моделей были разделены: Claude помогал создавать программную часть системы, а GigaChat использовался уже внутри готового сервиса для анализа документов и поиска необходимой информации.
В процессе разработки Claude также использовался для запуска проекта локально, тестирования, поиска и исправления ошибок. Дополнительно команда подключила AI-агентов, которые проверяли безопасность, логику работы и возможные ошибки в коде.
При этом архитектура решения, бизнес-логика и ключевые инженерные решения оставались зоной ответственности команды ASAP. Claude выступал как инструмент ускорения разработки, а не как замена инженерной экспертизы.
Преобразование ответов AI в данные для автоматической проверки
Одной из самых сложных задач стала работа с ответами языковой модели.
Для автоматического аудита GigaChat должен был возвращать результат в строго определенном формате JSON: каждый пункт чек-листа должен был иметь собственный статус и набор необходимых данных.

Однако ответ языковой модели не всегда полностью соответствовал ожидаемому формату. В отдельных случаях модель могла добавлять лишнее форматирование, изменять структуру данных или возвращать неполный результат.
Для человека такие различия практически незаметны, но в автоматизированной системе даже небольшое отклонение от формата может остановить дальнейшую обработку.
Поэтому команда разработала дополнительный механизм обработки ответов модели.
Специальный парсер проверяет полученный результат и приводит его к формату, который ожидает система. Он обрабатывает типовые отклонения от заданной структуры: восстанавливает корректный JSON, исправляет ошибки форматирования и подготавливает данные для дальнейшей проверки.
Кроме этого, каждый запрос выполняется с механизмом повторных попыток. Если GigaChat возвращает ошибку или некорректный ответ, система автоматически повторяет запрос до трех раз без участия пользователя.
Все это позволило отделить анализ документов, который выполняет языковая модель, от контроля и обработки результатов, которые выполняются на уровне приложения.
Проверка надежности результатов AI
Еще одной особенностью проекта стала необходимость дополнительной проверки результатов AI.
Иногда GigaChat подтверждал соответствие требованиям даже в тех случаях, когда данные в документах расходились. В других ситуациях модель могла сообщить об отсутствии документа, хотя файл действительно присутствовал в переданном комплекте.

Поэтому доверять единственному ответу модели было нельзя. Для повышения надежности проверки использовалась трехуровневая система контроля.
Первый уровень — строгие инструкции.
По умолчанию каждый пункт чек-листа считался невыполненным.
Чтобы присвоить ему статус «ОК», модель должна была самостоятельно найти подтверждающие сведения в документах, привести соответствующую цитату и показать логику проверки. Только после этого система принимала положительный результат.
Второй уровень — повторная проверка
Каждый положительный результат проходил дополнительную проверку.
При этом задача второго прохода заключалась не в подтверждении предыдущего вывода, а в поиске возможных несоответствий. Если обе проверки приходили к одинаковому результату, надежность результата повышалась.
Третий уровень — программная проверка
Параметры, которые можно проверить однозначно, не передавались на оценку модели.
Сравнение дат, числовых значений, количества смен, численности сотрудников и других параметров выполнялось программной логикой.
Такой подход позволил разделить зоны ответственности: AI используется для анализа содержания документов и поиска необходимой информации, а критичные проверки выполняются средствами программного кода.
Подготовка документов к AI-анализу
Значительная часть документов в аудиторских комплектах поступала в виде отсканированных копий. Перед анализом такие файлы необходимо было преобразовать в текст, чтобы передать их на дальнейшую обработку AI.
Для этого в системе использовалась технология OCR — оптическое распознавание текста. В проекте применялась сторонняя библиотека с поддержкой русского языка и различных кодировок, которая позволяла извлекать содержимое из изображений и подготавливать его для анализа.
При этом качество исходных сканов напрямую влияло на результат распознавания. Смещенные страницы, низкое разрешение или особенности сканирования могли приводить к ошибкам в адресах, фамилиях, номерах документов и других данных.
Чтобы снизить влияние таких ошибок, после OCR система дополнительно применяла механизмы нечеткого сравнения строк и проверку смысла с помощью AI. Это позволяло корректнее обрабатывать данные даже в случаях, когда текст был распознан не идеально.
Поскольку обработка большого количества сканов требует значительных ресурсов, результаты OCR сохранялись рядом с исходными файлами и могли использоваться повторно без повторного распознавания.
Обработка документов выполнялась параллельно в несколько потоков. Благодаря этому проверка комплекта примерно из 30 документов занимала около 20 минут вместо нескольких часов ручной работы.
Проверка согласованности данных между документами
Автоматизация аудита требовала не только поиска информации в документах, но и проверки того, насколько данные из разных источников соответствуют друг другу.
Для этого в системе были реализованы дополнительные механизмы контроля. Например, для сокращенных наименований организаций используется библиотека соответствий, которая помогает сопоставлять разные варианты написания и учитывать ошибки, возникающие при распознавании документов.
Система также анализирует связанные данные из разных файлов. Если информация в документах расходится, например, в одном документе указан один проверяющий, а подпись принадлежит другому человеку, система фиксирует несоответствие и передает его на дополнительную проверку.
Результаты проекта
В результате заказчик получил систему автоматической проверки документов, которая анализирует комплект файлов, сопоставляет данные между источниками и формирует результаты проверки по аудиторскому чек-листу.
Первую рабочую версию решения команда собрала за 8 часов: MVP, который позволил проверить основной сценарий загрузки документов и автоматического анализа.
Полноценная реализация первой версии с учетом доработок и проверки гипотез заняла около 18 часов.
После первой версии решения была разработана дополнительная система на той же архитектуре. Она поддерживает второй чек-лист и позволяет выполнять два независимых аудита одновременно.
В новой версии появился механизм ручной проверки для случаев, когда автоматический анализ недостаточно надежен или требуется участие специалиста. Если система не может подтвердить пункт чек-листа, она не формирует предположение, а передает его на дополнительную проверку.
На момент подготовки кейса решение проходит тестирование. Заказчик подключил собственный API GigaChat через Sber Studio и использует систему для проверки документов.
Раньше анализ одного комплекта документов занимал около четырех часов работы специалиста. После автоматизации проверка выполняется примерно за 20 минут.
В рамках проекта удалось:
- автоматизировать проверку документов по аудиторским чек-листам;
- сократить время обработки документов;
- снизить влияние человеческого фактора;
- стандартизировать процесс проверки;
- сохранить возможность ручного контроля сложных случаев;
- создать архитектуру, которую можно расширять новыми сценариями проверки.
Что показал проект
Этот проект показал: ценность AI-сервиса определяется не самой языковой моделью, а системой вокруг нее.
AI хорошо справляется с анализом содержания документов, поиском информации и работой с неструктурированным текстом. При этом проверки, где требуется точное сравнение данных, расчеты и однозначные правила, должны выполняться программной логикой.
Именно сочетание AI и классической инженерии позволило создать систему, пригодную для автоматизации реального аудиторского процесса.
MVP можно быстро собрать и проверить на практике, но переход к полноценному production-решению требует архитектуры, инженерной экспертизы и команды, которая сможет развивать систему дальше.
Стек технологий
Claude Sonnet
Python
HTML
Giga chat
Сотрудники
Антон Воловод
Менеджер проектов