Технологии

SlideAgent повышает точность анализа сложных документов для нейросетей

25 августа 12 просмотров 1 минута на чтение
Размер шрифта: А А А

Исследователи из Georgia Tech и J. P. Morgan создали SlideAgent — программный фреймворк, который позволяет большим языковым моделям (LLM) точнее анализировать сложные визуальные документы: презентации, брошюры и отчеты. Система имитирует человеческий способ чтения, разделяя анализ на уровни, что повышает точность интерпретации данных по сравнению с существующими коммерческими и открытыми моделями. Однако работа фокусируется на архитектуре обработки информации, а не на создании новой нейросети с нуля.
В этом материале:

Принцип работы SlideAgent

Результаты тестирования и точность

Ограничения и выводы

Принцип работы SlideAgent

Современные мультимодальные модели (например, GPT, Gemini или Claude) часто обрабатывают страницу документа целиком как единый объект. Это приводит к ошибкам: ИИ может пропустить сноску, неправильно посчитать элементы в диаграмме или исказить данные в плотных таблицах.
SlideAgent меняет этот подход, используя многоуровневую систему анализа. Вместо одного общего сканирования сеть специализированных агентов обрабатывает информацию в три этапа:

SlideAgent повышает точность анализа сложных документов для нейросетей
Читать полностью на сайте www.pravda.ru