Вернуться к новостям
ИнновацииAI Understanding брифинг

Препринт предлагает проверяемую структуру для финансовой аналитики LLM.

В новом препринте arXiv утверждается, что корпоративные финансовые системы, использующие большие языковые модели, следует оценивать не только по точности ответов, но и по тому, можно ли проследить каждое утверждение до авторитетных доказательств. Предложенная им структура улучшила отслеживаемость цитирования при оценке из 145 вопросов, одновременно создавая…

5 min readRead the primary source
Source-page capture accompanying Preprint proposes an auditable framework for finance-focused LLM analytics
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.20661
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
RAG (генерация с расширенным поиском)
Метод, который извлекает внешние знания и вводит их в генерацию во время вывода.
Доверительный интервал
Статистический диапазон, который, вероятно, содержит истинное значение измеренного показателя модели.
Проверьте себяChatGPT и викторина для студентов LLM

Что случилось

В новом препринте arXiv представлена ​​платформа аналитики, основанной на знаниях, основанный на онтологиях подход, позволяющий упростить аудит аналитики больших языковых моделей в корпоративных финансах. Система присоединяет к полученным фактам типы отношений, достоверную информацию и происхождение источника.

В документе, представленном arXiv 21 августа, описывается платформа аналитики, основанной на знаниях, или KDAF, для генерации дополненной информации в сфере корпоративных финансов. Его заявленная направленность — финансовое планирование и анализ, а также другие регулируемые рабочие процессы, где пользователям необходимо установить, откуда пришел ответ постфактум. Фреймворк создает систему знаний, основанную на онтологии, посредством шести итеративных этапов и использует метод поиска, называемый контекстно-зависимым распространением релевантности, или CARP.

Согласно статье, каждый полученный факт несет в себе три вида информации: тип связи, значение достоверности и происхождение источника. Цель состоит в том, чтобы сделать структуру доказательств явной, а не рассматривать найденные отрывки как недифференцированное контекстное окно. В документе также говорится, что авторы разместили конфигурации, схему онтологии, подсказки, отчеты об аудите и сценарии реконструкции, хотя представленный здесь источник не проверяет независимо друг от друга артефакт и не описывает удобство его использования.

Для оценки использовались 145 вопросов из FinanceBench и сравнивались KDAF с выводом без контекста, поиском BM25, концептуально-взвешенным лексическим поиском и необоснованным обходом графа. В документе сообщается, что вывод с нулевым контекстом достиг 4,1% правильности, в то время как условия с расширенным поиском достигли примерно 10–12%. Это подтверждает более узкий вывод о том, что получение доказательств было важно для этого теста, но это не означает, что KDAF в целом превосходит все финансовые задачи.

Основным результатом является разделение правильности ответа и проверяемости. В документе сообщается, что KDAF и BM25 были статистически неотличимы по правильности ответов с заявленной разницей -0,007 и 95% доверительным интервалом от -0,021 до 0,000. Однако по отслеживаемости цитирования F1 KDAF набрал 0,515, превысив необоснованный обход на 0,027, а BM25 на 0,052, с доверительными интервалами, исключающими ноль. В документе также сообщается, что ни один из 426 элементов поиска с графической структурой не пришел извне предметной сущности вопроса, по сравнению с 16,8% и 20,2% для лексических базовых показателей, и что каждый выбранный элемент разрешался в полную цепочку происхождения.

Подробности об источнике: arxiv.org ↗

Почему это важно

В статье рассматривается практическое препятствие для использования языковых моделей в финансовом планировании и анализе, а также в других регулируемых рабочих процессах: ответ может быть беглым, но непригодным для использования, если его доказательства невозможно реконструировать. Результаты показывают, что проверяемость может улучшиться, даже если точность ответов не изменится.

Практическая проблема знакома организациям, экспериментирующим с языковыми моделями: система может выдать правдоподобное финансовое объяснение, не давая аудитору надежного пути назад к основным записям. В регулируемой или финансово значимой работе эта слабость влияет на анализ, исправление ошибок, подотчетность и способность объяснять, как был получен результат. Поэтому в документе прослеживаемость рассматривается как отдельное свойство системы, а не предполагается, что лучший поиск автоматически означает лучшие ответы.

Сообщенные результаты бросают вызов общепринятому подходу к оценке. Если системы сравниваются главным образом по точности ответов, структурированный метод в этой статье не будет явно оправдывать его дополнительную сложность в тестируемом тесте. Его заявленная точность была статистически аналогична BM25, более простому подходу к лексическому поиску. Вместо этого заявленное преимущество заключается в следе доказательств: сохранение связей между сущностями и их происхождения может сделать результаты более проверяемыми, даже если это не делает их более верными с точки зрения фактов.

Это различие может иметь значение для команд, решающих, какой объем инфраструктуры построить вокруг корпоративного ИИ. Система поиска, разработанная для определения происхождения, может помочь рецензентам определить источник и объем претензии, обнаружить доказательства, принадлежащие не той организации, и реконструировать материалы, используемые моделью. Эти возможности могут быть ценными в финансах, но источник не показывает, что KDAF сократил финансовые потери, сократил количество проверок, улучшил решения или прошел официальную оценку соответствия.

В статье также содержится полезное предостережение против рассмотрения структурированного поиска как универсального решения по обеспечению точности. Его собственный отрицательный результат говорит о том, что обоснование онтологии принесло заявленную стоимость по оси проверяемости, а не по правильности ответов. Это делает исследование актуальным для принятия решений о закупках и управлении: организациям может потребоваться выбирать системы, основываясь на последствиях непроверяемых результатов, при этом отдельно проверяя фактическую производительность, покрытие, задержку, требования к обслуживанию и общую стоимость.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Интерактивная проверка концепции+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

Что посмотреть дальше

Работа представляет собой оценку препринта, сообщенную автором, а не свидетельство развертывания производства или принятия регулирующими органами. Последующее тестирование должно изучить более крупные и разнообразные наборы финансовых данных, изменяющиеся исходные документы, реальные рабочие процессы пользователей, эксплуатационные расходы и то, могут ли аудиторы надежно использовать информацию о происхождении.

Непосредственный вопрос заключается в том, сохранится ли заявленное преимущество прослеживаемости за пределами оценки FinanceBench, состоящей из 145 вопросов. В будущей работе необходимо проверить больше компаний, отчетных периодов, условий бухгалтерского учета, форматов документов и типов вопросов, включая вопросы, связанные с неоднозначными объектами или неполными записями. Источник не указывает, как работает KDAF, когда авторитетные источники не согласны, содержат ошибки или вносятся изменения после получения ответа.

Запас артефакта мог бы облегчить воспроизведение работы, но его практическая ценность из предоставленного источника остается неизвестной. Неясно, выполняются ли сценарии реконструкции в обычных корпоративных средах, сколько требуется ручного построения онтологий и как часто необходимо обновлять систему знаний. Эти детали определят, будет ли метод полезным средством контроля для финансовых команд или, главным образом, исследовательским прототипом.

Операционные компромиссы также нуждаются в измерении. Источник не предоставляет данные о затратах на развертывание, времени отклика, требованиях к хранению, деталях модели, кадровых потребностях или сравнениях с другими поисковыми системами, сохраняющими происхождение. Он также не показывает, откалиброваны ли сообщенные значения достоверности, правильно ли их понимают пользователи или гарантирует ли полная цепочка происхождения, что приведенные доказательства действительно подтверждают сгенерированное утверждение.

Наконец, статья представляет собой препринт и представляет результаты собственной оценки авторов. В источнике нет никаких доказательств независимого тиражирования, внедрения в производство, одобрения регулирующих органов или улучшения реальных финансовых результатов. Следующим наиболее значимым доказательством будет независимое тестирование с контролируемыми изменениями в исходных данных, исследования человеческого аудита и оценка того, помогает ли информация о происхождении рецензентам выявить неправильные, неполные или несоответствующие сущности выходные данные модели.

Сопутствующие руководства и викторины

ChatGPT и LLMОбъяснение моделей искусственного интеллектаЭтика ИИОбучение искусственному интеллектуПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?