Guardian of Truth
Разработка новых методов детекции галлюцинаций LLM-моделей
Разработка новых методов детекции галлюцинаций LLM-моделей
Бинарная классификация одного хода агента: по контексту, который видел агент,
и его ответу определить, есть ли в ответе галлюцинация (1) или нет (0).
Галлюцинация — утверждение или действие агента, не обоснованное доступным ему контекстом: выдуманный факт/число/id, вызов недоступного инструмента, неверные аргументы, нарушение правил политики, ложный отказ и т.п.
| колонка | тип | описание |
|---|---|---|
id | string | идентификатор примера |
prompt | string | вход: контекст, который видел агент |
response | string | вход: проверяемый ход агента |
label | int (0/1) | таргет: 1 — галлюцинация, 0 — нет |
explanation | string/null | справочное пояснение разметки |
explanation — пояснение, почему ход помечен галлюцинацией (заполнено только при label=1).
Это техническое поле для ознакомления. Оно НЕ является входными данными: модель должна
предсказывать label только по prompt и response, не используя explanation.
promptТекстовый транскрипт с маркерами:
⟦SYSTEM⟧ — системная инструкция + <policy> (правила домена) + [AVAILABLE TOOLS]⟦USER⟧ — реплики клиента;⟦ASSISTANT⟧ — прежние реплики агента;→ TOOL_CALL <имя>: {аргументы} — вызов инструмента;
← TOOL_RESPONSE <имя>: <результат> — ответ среды.responseresponse — сам размечаемый ход агента, содержит:
⟦ASSISTANT⟧ с текстом-ответом клиенту;и/или
→ TOOL_CALL <имя>: {аргументы} -один или несколько вызовов функций.valid.parquet
Сэмпл для скачивания