ПОДБОРКА
AI и данные
Машинное обучение, статистика, аналитика и информационные модели.
Что даст подборка
Систематизировать ключевые идеи AI, машинного обучения, статистики и данных.
Библиотека сценариев AI red teamВерсионируемый набор атакующих и пограничных сценариев для повторяемой проверки безопасности AI-системы.Загрязнение набора AI-оценкиПопадание оценочных примеров в обучение, настройку или ручной подбор решений, из-за чего метрики перестают отражать обобщение.Обоснование безопасности AIСтруктурированный аргумент с доказательствами того, что риски AI-системы известны, контролируются и приемлемы для заданного контекста.Принятие остаточного AI-рискаФормальное решение ответственного лица принять оставшийся риск после выполнения доступных мер контроля.Проверка плана AI-агентаПроверка плана агента на допустимость действий, полноту предпосылок, ограничения и потенциальный ущерб до исполнения.Состязательная оценка AIПроверка модели на намеренно сложных, обманных или вредоносных входах, созданных для выявления слабых мест.Бюджет стоимости: защитный механизм AIДля объекта «защитный механизм AI» это явный предел потребления вычислений, хранения или внешних сервисов с контролируемым действием при превышении.Бюджет стоимости: индекс эмбеддинговДля объекта «индекс эмбеддингов» это явный предел потребления вычислений, хранения или внешних сервисов с контролируемым действием при превышении.Бюджет стоимости: маршрутизатор моделейДля объекта «маршрутизатор моделей» это явный предел потребления вычислений, хранения или внешних сервисов с контролируемым действием при превышении.Бюджет стоимости: оценка LLMДля объекта «оценка LLM» это явный предел потребления вычислений, хранения или внешних сервисов с контролируемым действием при превышении.Бюджет стоимости: реестр промптовДля объекта «реестр промптов» это явный предел потребления вычислений, хранения или внешних сервисов с контролируемым действием при превышении.Бюджет стоимости: синтетический набор данныхДля объекта «синтетический набор данных» это явный предел потребления вычислений, хранения или внешних сервисов с контролируемым действием при превышении.Бюджет стоимости: человеческая проверка AIДля объекта «человеческая проверка AI» это явный предел потребления вычислений, хранения или внешних сервисов с контролируемым действием при превышении.Монитор дрейфа: RAG-конвейерДля объекта «RAG-конвейер» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.Монитор дрейфа: индекс эмбеддинговДля объекта «индекс эмбеддингов» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.Монитор дрейфа: инструменты агентаДля объекта «инструменты агента» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.Монитор дрейфа: оценка LLMДля объекта «оценка LLM» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.Монитор дрейфа: реестр промптовДля объекта «реестр промптов» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.Монитор дрейфа: синтетический набор данныхДля объекта «синтетический набор данных» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.Монитор дрейфа: шлюз inferenceДля объекта «шлюз inference» это повторяемая проверка изменения поведения, данных или конфигурации относительно принятого базового состояния.Регрессионный шлюз: маршрутизатор моделейДля объекта «маршрутизатор моделей» это обязательное сравнение с зафиксированным эталоном перед продвижением изменения на следующий этап.Регрессионный шлюз: шлюз inferenceДля объекта «шлюз inference» это обязательное сравнение с зафиксированным эталоном перед продвижением изменения на следующий этап.Трасса доказательств: RAG-конвейерДля объекта «RAG-конвейер» это связанная последовательность входов, решений, версий и результатов, позволяющая объяснить и воспроизвести итог.Трасса доказательств: защитный механизм AIДля объекта «защитный механизм AI» это связанная последовательность входов, решений, версий и результатов, позволяющая объяснить и воспроизвести итог.Трасса доказательств: инструменты агентаДля объекта «инструменты агента» это связанная последовательность входов, решений, версий и результатов, позволяющая объяснить и воспроизвести итог.Трасса доказательств: маршрутизатор моделейДля объекта «маршрутизатор моделей» это связанная последовательность входов, решений, версий и результатов, позволяющая объяснить и воспроизвести итог.Трасса доказательств: человеческая проверка AIДля объекта «человеческая проверка AI» это связанная последовательность входов, решений, версий и результатов, позволяющая объяснить и воспроизвести итог.Трасса доказательств: шлюз inferenceДля объекта «шлюз inference» это связанная последовательность входов, решений, версий и результатов, позволяющая объяснить и воспроизвести итог.MAP-оцениваниеМаксимизирует апостериорную вероятность с учетом априорного знания.MARДопускает зависимость пропусков от наблюдаемых переменных.MCARПредполагает независимость пропусков от наблюдаемых и скрытых данных.MNARПропуски зависят от самих отсутствующих значений или скрытых факторов.Атомистическая ошибкаСвойства отдельных людей ошибочно переносятся на группы.Аудит действий AI-агентаНеизменяемая последовательность решений, вызовов инструментов, аргументов, результатов и подтверждений агента.БутстрэпОценивает неопределенность повторной выборкой из наблюдаемых данных.Граница Крамера-РаоЗадает нижнюю границу дисперсии несмещенной оценки.Граница ЧерноваОценивает хвостовые вероятности суммы независимых случайных величин.Граница объединенияОграничивает вероятность хотя бы одного события суммой их вероятностей.Граница памяти AI-агентаПравило, определяющее какие данные агент может сохранять, как долго и между какими пользователями или задачами их разрешено переносить.Декомпозиция задачи AI-агентомРазбиение сложной цели на проверяемые шаги с явными зависимостями, результатами и условиями завершения.Задержка получения метокПромежуток между прогнозом модели и появлением достоверного результата, ограничивающий скорость оценки качества.Закон больших чиселСреднее наблюдений приближается к математическому ожиданию при росте выборки.Инструментальная переменнаяПомогает оценивать причинный эффект при скрытом смешении.Информация ФишераИзмеряет количество информации наблюдений о неизвестном параметре.Калибровка LLM-судьиОценки модели-судьи сравниваются с человеческими решениями, чтобы измерить смещение и устойчивость критериев.Каскад моделейЗапрос сначала обрабатывается дешёвой моделью, а сложные случаи передаются более мощной по измеримому правилу.Контрольная точка состояния AI-агентаСохранённое состояние плана, контекста и выполненных действий, позволяющее безопасно продолжить или восстановить работу агента.КонфаундингСкрытая переменная искажает наблюдаемую связь причины и результата.Лемма Бореля-КантеллиОпределяет, когда события происходят бесконечно часто.Лемма Неймана-ПирсонаОпределяет наиболее мощный тест между двумя простыми гипотезами.Метод максимального правдоподобияВыбирает параметры, при которых наблюдаемые данные наиболее вероятны.Метод складного ножаОценивает смещение и дисперсию последовательным исключением наблюдений.Мониторинг дрейфа AI-данныхОтслеживание изменений распределений входных данных относительно контрольного периода или обучающего набора.Неравенство МарковаОграничивает вероятность большого значения неотрицательной случайной величины.Неравенство ХёффдингаДает экспоненциальную границу отклонения суммы ограниченных независимых величин.Неравенство ЧебышёваОценивает отклонение от среднего через дисперсию без знания распределения.Область разрешений AI-инструментаМинимальный набор операций и ресурсов, доступных агенту через конкретный инструмент в данном сценарии.Ограниченное декодированиеПроцесс генерации ограничивает допустимые токены так, чтобы результат соответствовал грамматике или структуре.Оценка AI по срезамРаздельное измерение качества модели на важных сегментах данных, пользователей и условий вместо одной средней метрики.Оценка RAG-системыОтдельно измеряются качество поиска, достаточность контекста, верность ответа и корректность цитирования.Оценка воздействия AIСтруктурированная оценка возможного влияния AI-системы на пользователей, процессы, права, безопасность и бизнес-результаты.Оценка возможностей AIПроверка того, какие задачи модель действительно способна выполнять, включая новые возможности после обновления.Парадокс БерксонаОтбор по общему следствию создает ложную зависимость между причинами.Парадокс СимпсонаСвязь между двумя показателями может ослабнуть, исчезнуть или поменять направление после объединения групп с разными долями и исходными условиями.Переключение AI-провайдераКонтролируемый переход на резервного поставщика или модель при отказе, ограничениях или недоступности основного варианта.Переранжирование найденных фрагментовВторичная модель оценивает релевантность кандидатов и меняет порядок перед передачей контекста генератору.Переформулирование поискового запросаИсходный вопрос преобразуется в один или несколько запросов, лучше подходящих для поискового индекса.Пермутационный тестСтроит нулевое распределение перестановкой меток или значений.План человеческого контроля AIПравила, определяющие где человек проверяет, подтверждает, отменяет или расследует решения и действия AI-системы.Покрытие AI-оценкиДоля значимых сценариев, рисков, языков, групп пользователей и режимов отказа, представленная в наборе оценки.Покрытие ответа источникамиДоля проверяемых утверждений ответа, которые связаны с доступными источниками или данными контекста.Политика восстановления AI-агентаПравила возобновления, отката или завершения задачи агента после ошибки, тайм-аута или частично выполненного действия.Поправка БонферрониКонтролирует семейную вероятность ошибки уменьшением порога значимости.Принцип достаточностиСводит данные к статистике, сохраняющей информацию о параметре.Принцип правдоподобияСчитает функцию правдоподобия главным носителем информации о параметре.Приоритет источников контекстаЯвный порядок доверия между системными правилами, внутренними данными, пользовательским вводом и внешними документами.Проблема множественных проверокРост числа тестов увеличивает вероятность ложных открытий.Проверка результата AI-инструментаВалидация структуры, происхождения и допустимости данных, возвращённых инструментом агенту, до их дальнейшего использования.Происхождение AI-контентаМетаданные и сигналы, позволяющие установить, как, когда и какой системой был создан или изменён контент.Происхождение данных AIПрослеживаемая история источников, преобразований, разрешений и версий данных, используемых AI-системой.Процедура Бенджамини-ХохбергаКонтролирует ожидаемую долю ложных открытий.Разность разностейОценивает эффект вмешательства сравнением изменений двух групп.Расхождение обучения и инференсаРазличие между данными или преобразованиями при обучении и в production, вызывающее непредсказуемое ухудшение модели.Реагирование на AI-инцидентыПроцесс обнаружения, локализации, расследования и устранения вредных или непредсказуемых результатов AI-системы.Регрессионное ослаблениеОшибка измерения независимой переменной занижает оценку связи.Регрессионный разрывИспользует порог назначения воздействия для оценки причинного эффекта.Регрессионный шлюз AIАвтоматический запрет выпуска модели или промпта, если новая версия ухудшает критические метрики относительно контрольной версии.Свежесть данных извлеченияВозраст и актуальность документов, полученных системой поиска для формирования ответа или решения.Семантический кэшРезультат переиспользуется для достаточно похожего запроса только при совместимых контексте, правах и свежести.Сжатие контекстаДлинная история заменяется проверяемым кратким состоянием, сохраняя решения, ограничения и открытые вопросы.Синтетический контрольСоздает взвешенную контрольную группу для оценки вмешательства.Смещение коллайдераУсловие на общий эффект создает ложную связь между его причинами.Сопоставление по склонностиБалансирует наблюдаемые различия между группами воздействия и контроля.Теорема БайесаОбновляет вероятность гипотезы после получения новых данных.Теорема Крамера-УолдаХарактеризует многомерное распределение через линейные комбинации.Теорема СлуцкогоПозволяет комбинировать сходящиеся случайные величины и статистики.Теорема о непрерывном отображенииПереносит сходимость случайных величин через непрерывные функции.Трассируемость AI-ответаВозможность связать конкретный ответ модели с запросом, версией модели, настройками, источниками и вызванными инструментами.Управление изменениями AI-моделиПроцесс оценки, тестирования и утверждения изменений модели, провайдера, данных, настроек или системного промпта.Уровни риска AI-сценариевКлассификация AI-сценариев по потенциальному вреду и масштабу последствий, определяющая глубину проверок и контроля.