SYSTEM ATLASЗагрузка материала

Оценка RAG-системы

RAG Evaluation

Отдельно измеряются качество поиска, достаточность контекста, верность ответа и корректность цитирования.

Простыми словами

Представьте приложение с моделью, которая получает данные и выдаёт прогноз, ответ или действие. Важно понимать не только итог модели, но и какие данные, ограничения и проверки привели к нему, потому что уверенный результат всё равно может оказаться неправильным. Так модель остаётся частью контролируемого процесса, а её результат можно проверить, ограничить и пересмотреть. Поэтому модель проверяют на новых данных и ошибках, а не только на примерах, которые она уже видела.

Пример от @Vibeclakr

Пример при разработке

В проекте команда фиксирует практику «Оценка RAG-системы» как отдельное правило, добавляет автоматическую проверку и наблюдаемый критерий результата.

Это редакционный пример применения, а не часть определения или доказательство концепции.

Формальное определение

Отдельно измеряются качество поиска, достаточность контекста, верность ответа и корректность цитирования.

Механизм действия

Для «Оценка RAG-системы» команда задаёт явные границы, проверяемый контракт и сигнал, по которому видно соблюдение или нарушение правила.

Пример в работе

Нерабочий подход

Использовать «Оценка RAG-системы» как термин без владельца, критерия и проверки реального поведения.

Системный подход

Связать «Оценка RAG-системы» с конкретным риском, тестом или метрикой и пересматривать правило при изменении контекста.

Ограничения

Практика «Оценка RAG-системы» решает ограниченную задачу и не заменяет анализ всей системы, проверку исходных допущений и измерение побочных эффектов.

Источник

NIST, “Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile”, 2024.

Первоисточник