SlideAgent повышает точность анализа сложных документов для нейросетей
Исследователи из Georgia Tech и J. P. Morgan создали SlideAgent — программный фреймворк, который позволяет большим языковым моделям (LLM) точнее анализировать сложные визуальные документы: презентации, брошюры и отчеты. Система имитирует человеческий способ чтения, разделяя анализ на уровни, что повышает точность интерпретации данных по сравнению с существующими коммерческими и открытыми моделями. Однако работа фокусируется на архитектуре обработки информации, а не на создании новой нейросети с нуля.
В этом материале:
Принцип работы SlideAgent
Результаты тестирования и точность
Ограничения и выводы
Принцип работы SlideAgent
Современные мультимодальные модели (например, GPT, Gemini или Claude) часто обрабатывают страницу документа целиком как единый объект. Это приводит к ошибкам: ИИ может пропустить сноску, неправильно посчитать элементы в диаграмме или исказить данные в плотных таблицах.
SlideAgent меняет этот подход, используя многоуровневую систему анализа. Вместо одного общего сканирования сеть специализированных агентов обрабатывает информацию в три этапа: