Guardian of Truth
Разработка новых методов детекции галлюцинаций LLM-моделей
Разработка новых методов детекции галлюцинаций LLM-моделей
26 августа
Сколько тестовых и публичных примеров?
3
31 августа
Закрытая информация, количество стат. значимо
0
26 августа
"Использование Участниками проприетарных технологий, требующих возмездного приобретения прав на использование таких технологий, запрещено."
Правильно ли я понимаю, что в решении запрещено использовать API любых коммерческих LLM, в том числе API GigaChat?
2
31 августа
Все верно, доступа в публичные апи нет при обсчете решения.
0
26 августа
Будет ли участникам доступен baseline или какой-то другой пример кода?
2
31 августа
Будет
0
28 августа
Никак не получается загрузить паплайн. Ошибка 22. Статус расчета метрик
Code run. Что я делаю не так?
4
28 августа
Пайплайны не всегда запускаются при клике на "Запустить", а попытку списывает. И при падающих сабмитах тоже попытки списывает. Кажется, что ввиду строгого ограничения на 10 сабмитов на все соревнование - это проблема
1
28 августа
Да нет, у меня не списываются попытки, если паплайн неудачно загружен, то снова 10, но я не могу пройти шаг 22 Статус расчета метрик. Всё сделал по шаблону и ни одной строки непроверенной, а как понять ошибку, то не понять
2
29 августа
загрузите решение, и сделайте первый запуск. Осталось попыток: 9.
1
30 августа
Сейчас пять неудачных попыток, последняя висит на шаге 2 - очистке, уже более 5 часов. При этом осталось попыток: 3. Счетчик суточного лимита закончился, и попыток должно быть 10, потому что удачных попыток не было, но даже если неудачные попытки вычитать, у меня получается 5, а не 3.
1
29 августа
завис на 2 шаге (висит несколько часов). Новый пайплайн не могу запустить, мне ждать 24 часа? нельзя ли добавить кнопку сброса или отмены?
2
29 августа
Мы проверили со своей стороны всё, что доступно участнику:
структура архива приведена дословно к дереву из условия (root/ · pyproject.toml · model/ · src/ · scripts/predict.py);
запуск воспроизведён локально: pip install . и python scripts/predict.py --input … --output … завершаются кодом 0;
на выходе CSV с колонками id,label, кодировка UTF-8, перевод строки LF, идентификаторы отдаются из входного файла без изменений, одна строка выхода на каждую строку входа;
время работы — секунды при лимите 30 минут;
отдельно проверено тривиальное решение без модели вообще (только чтение колонки id) — оно останавливается на той же стадии 22.
4
30 августа
Уважаемые участники. Проблема относящаяся к функционированию счетчика попыток находится в работе, будет исправлена в ближайшее время.
4
31 августа
Уважаемые участники, добрый день. Количество оставшихся попыток было приведено в соответствие с фактическим количеством успешных запусков.
1
31 августа
Можно будет увидеть логи выполнения? 22 этап падает каждый раз, как бы я не изменял программу. Те у кого всё прошло, может есть какой совет?
2
31 августа
Добрый вечер. Напишите пожалуйста название команды и время запуска.
1
31 августа
Не ворк
0
1 сентября
Сообщение об ошибке:
2026-08-31T17:20:33Z [1,0]<stderr>:pyarrow.lib.ArrowInvalid[1,0]<stderr>:: Could not open Parquet input source '<Buffer>': Parquet magic bytes not found in footer. Either the file is corrupted or this is not a parquet file.
0
1 сентября
Спека говорит predictions.csv, а их ридер говорит parquet. Сейчас попробую parquet первым, а CSV — запасным путём.
0
1 сентября
У кого ошибка на 22 шаге, то parquet первым, а CSV — запасным путём.! Всё работает!
2
1 сентября
спасибо всем╰(*°▽°*)╯
0
31 августа
Ля, как я люблю этот турнир. Дали 1/7 часть архива Baseline
2
1 сентября
Уважаемые участники, бейзлайн по задаче будет выложен в открытый доступ в ближайшее время.
2
1 сентября
Добрый день! А когда будет выложен бейзлайн?
0
1 сентября
Добрый день! Подскажите, распределение на привате такое же, как в паблике или может быть смещение? Распределение в файле valid не равно распределению паблика, поэтому возникает такой вопрос.
0
1 сентября
Между тестами распределения совпадают
1
4 сентября
Можете добавить логи до пункта 10, чтобы не гадать почему падает решение?
5
4 сентября
Добрый день!
На странице конкурса указано 1× NVIDIA A100, в PDF правил (п. 3.7) — 1× H100. Какой GPU используется при обсчёте и какой объём памяти? Отрабатывает ли бейзлайн на этой карте?
В каком формате платформа передаёт --input и ожидает --output: parquet или csv? По комментариям участников ридер ожидает parquet, хотя в описании указан predictions.csv.
Есть ли доступ в интернет на этапе pip install . или все зависимости должны быть в окружении/образе?
4
7 сентября
Подходят оба формата, gpu используется А100.
0
6 сентября
Добрый вечер.
Не удается загрузить решение задачи, останавливается с ошибкой на этапе «08. Статус распаковки данных».
Пользователь «kessler8680», команда «xsfera».
Загрузка baseline.tar.gz 06.09.2026 17:47 (по Тольятти, GTM+3).
Для чистоты эксперимента загрузил baseline который скачал с сайта, склеив в один.
0
6 сентября
У меня tar и tar.gz не проходили. zip прошел
1
9 сентября
Подскажите где можно скачать baseline?
0
8 сентября
Добрый день! Вопрос по приглашениям в команду. Участник сначала нажал «Участвовать» сам (платформа создала ему соло-команду), затем покинул чемпионат, чтобы принять наше приглашение. Теперь приглашения ему не доходят: отправлял три раза (8 сентября 12:15, 12:29 и 12:56 мск), запросы проходят без ошибок, но письмо на его email не приходит (спам проверен), а вкладка Team у него не отображается, т.к. он вне чемпионата. Команда xhns-bros. Как правильно пригласить человека, вышедшего из чемпионата? Шлются ли email-приглашения пользователям, не участвующим в треке?
0
8 сентября
разобрались, форма чувствительна к регистру!
0
8 сентября
Почему падает на этапе 08. Статус распаковки данных" 08.09.2026 13:57? Команда ledner57164214
0
8 сентября
14 Статус распаковки данных 08.09.2026 17:40
0
8 сентября
Пожалуйста, не включайте в ваш архив с решением директорию с именем metrics
0
9 сентября
ledner57164214 08.09.2026 18:07 guardian_v06.zip крутится на этапе выгрузки второй метрики.
В решении нет директории metrics/
0
8 сентября
Не могу решение прогрузить (этап 3). В какой-то момент будто обновляется страница, и снова виджет с выбором папки/файлов.
strosin9861
Время буквально 3 минуты назад
2
8 сентября
Уточните пожалуйста, в каком браузере пытаетесь загрузить решение?
0
8 сентября
@blanda7513 Хром
0
8 сентября
в хроме такая же проблема бывает, кажется что если страница не в фокусе - то тогда может обновиться, можешь попробовать открыть в отдельном окне и чтоб всегда открыта вкладка была, так вроде помогает
0
8 сентября
Дополню ваши догадки: держал в фокусе браузер и даже так обновлялось. Но обновляется не сама страничка. Если во время загрузки файла держать нетворк вкладку открытой, то можно отследить следующую проблему: при загрузке иногда может слететь токен (ключ или как ещё называется) из за чего апи ответит 401 unauthorized и загрузка сбросится
0
8 сентября
@renner4544 Спасибо, попробую
0
8 сентября
@strosin9861 вы не могли бы попробовать воспроизвести проблему с открытой консолью браузера, записать har файл и прислать его в поддержку или приложить его здесь, в комментариях? Это помогло бы нам локализовать возникающую у вас проблему.
https://cloud.ru/docs/overview/support/topics/guides__har_log
0
9 сентября
Та же проблема, еще и скорость загрузки меньше стала
0
9 сентября
С любовью, ПайплайнНаКиреешкахОтХипонга
0
9 сентября
9 сентября
Почините платформу, пожалуйста, желания вообще нет участвовать при таких проблемах. Соревнование превращается в задачу "Загрузить решение". У вас был целый год, и ничего не изменилось от слова совсем.
1
9 сентября
У них фронт отваливается. Скину скрипт для бэкэнда. Загрузка не прерывается
0
9 сентября
С любовью, ПайплайнНаКиреешкахОтХипонга
0
9 сентября
12 сентября
Спасибо, с меня киреешки)
1
11 сентября
Вообще, было бы невероятно круто, если бы у нас была информация об окружении. Потому что тащить 10 гигабайт своих wheel для всяких мелких ЛЛМок которые сортируют - нууу такое себе
0
11 сентября
vLLM 0.19.1 стоит, кому нужно
0
12 сентября
Сколько видеопамяти доступно одному решению, 40 или 80 ГБ? Если установлен отдельный лимит ниже полного объема карты, уточните его, плс.
2
14 сентября
40 ГБ на решение
0
14 сентября
Уточните, пожалуйста: 40 ГБ — это лимит видеопамяти GPU во время инференса или размер архива решения? В запусках сейчас доступна вся A100 80 ГБ. Будет ли лимит видеопамяти меняться для приватного обсчёта?
3
16 сентября
Размер архива, по гпу памяти лимит 80гб
0
14 сентября
как посмотреть что конкретно за ошибка? типо просто написано 08. Статус распаковки данных
Как это интерпретировать?
0
15 сентября
Команда paucek55315274: те же симптомы с 14.09 ~13:40 МСК — стадии 01–07 зелёные, затем красная 08 «Статус распаковки данных». Проверили валидный классический zip и tar: ошибка идентична, архив решения локально распаковывается корректно. Есть ли способ увидеть текст ошибки и идёт ли восстановление?
0
15 сентября
Здравствуйте, хочу уточнить некоторые моменты по Guardian of Truth:
1. Лимит 30 минут включает время запуска vLLM и загрузки весов модели или считается только инференс?
2. Скрипт predict.py получает публичный и приватный тест одним файлом за один запуск или это два отдельных запуска со своим лимитом 30 минут каждый?
3. Есть ли доступ в интернет на шаге pip install . или все зависимости должны быть уже в окружении или в архиве?
4. Допустимо ли на этапе разработки (не внутри решения) прогонять valid.parquet через открытые модели, размещённые у сторонних хостеров, и использовать для создания дополнительных обучающих данных открытые бенчмарки (например, tau-bench) и синтетические данные?
Заранее спасибо, за ответ.
3
16 сентября
Два отдельных запуска
3. Нет доступа
4. Естесна, в правилах нет ничего на эту тему. К тому же Паркет у тебя урезанный в хлам
1
15 сентября
Здравствуйте! При попытке запустить решение Guardian of Truth возникает проблема на этапе проверки:
Очистка дискового пространства — успешно
Статус очистки — успешно
Загрузка решения — успешно
Статус загрузки решения — успешно
Загрузка данных чемпионата — успешно
Статус загрузки данных — успешно
Распаковка данных — отображается как выполненная
Статус распаковки данных — ошибка
При этом интерфейс не показывает текст или код ошибки, поэтому невозможно понять, связана ли проблема с архивом решения или с инфраструктурой запуска.
Архив решения локально корректен, submission загружается без ошибок. В комментариях также вижу сообщения других участников с аналогичной проблемой на этапе 08.
Подскажите, пожалуйста:
Можно ли получить текст/код ошибки для конкретного запуска?
Известна ли сейчас проблема с этапом распаковки данных?
Нужно ли нам что-то менять в архиве решения или достаточно дождаться восстановления сервиса?
Спасибо!
0
15 сентября
Здаров, мужик, у меня было такое же падение на шаге 08 без текста ошибки. Помогло следующее, возможно, пригодится:
1. Права доступа внутри zip. Если архив собран на Windows или через Python zipfile без явных прав, папки внутри архива могут получить права 0600, то есть без права входа. Площадка распаковывает архив на Linux и запускает решение от обычного пользователя, а в такие папки он зайти не может. Проверить можно так: zipinfo ваш_архив.zip. У папок должно быть drwxr-xr-x, у файлов не меньше -rw-r--r--. Лучше пересобрать архив на Linux обычной командой zip -r или задать права явно.
2. Файлы в корне архива, без папки верхнего уровня. Площадка запускает <папка распаковки>/scripts/predict.py. Если всё лежит внутри папки, шаг 08 пройдёт, но на шаге 10 будет ошибка «can't open file .../scripts/predict.py».
3. Формат zip. У нескольких участников tar и tar.gz не проходили. В архиве не должно быть папки metrics, об этом просил организатор. Имя архива на всякий случай лучше латиницей.
4. Выход predict.py лучше всегда писать в parquet, даже если путь в --output оканчивается на .csv: площадка читает предсказания как parquet.
Упавшие запуски попытку не списывают, так что можно спокойно пробовать. Текст ошибки площадка показывает, похоже, только при ошибке на шаге запуска кода (10), но не на шаге 08.
3
16 сентября
Подскажите, пожалуйста, в чём может быть проблема на этапе 22. Статус расчёта метрик?
Submission проходит все предыдущие этапы:
загрузка и распаковка решения — OK;
inference на limited set — OK;
inference на full set — OK;
загрузка и распаковка validation — OK;
этап 21 «Расчёт метрик» запускается;
этап 22 «Статус расчёта метрик» завершается ошибкой.
Локально output корректный: CSV содержит id,label, 46 строк, уникальные id, без NaN, label только 0/1.
Есть ли возможность посмотреть лог/причину ошибки именно на этапе 22?
0
17 сентября
Паркет требует, брат
1
16 сентября
В документе правил написано что для конкурса Гварды для теста выделены по 1× GPU NVIDIA H100. В описании сказано, выделены 1× GPU NVIDIA A100. Я предполагаю что стоит верить правилам больше, то есть определённо выделено 80 GB Видеопамяти на инференс. Это верно?
0
21 сентября
Выделена 1 GPU A100 80GB
0
16 сентября
В турнирной таблице 18 медалей по 6 на золото серебро и бронзу, является ли это просто стилизованным решением или призовые будут делиться на всех в своём домене поровну, то есть условно не 796 тысяч первому месту (после вычета налога), а 132 тысячи каждому из 6 первых мест. Я могу предположить второе из-за того что, на том же Green Chalange всего три медали по одному на каждое место. Информации в своде правил я не нашёл (там просто первое, второе, третье места). Конечно логично платить только за конкретные места, в конце концов чемпионаты это покупка Сбером наработок в соревновательном формате и судя по комментарию. под другими конкурсом: "Медаль это внутриплатформенное достижение." - можете подтвердить?
0
18 сентября
это просто медальки как на каггле, призы получают обычные топ 3 и все
0
19 сентября
1. Что происходит при превышении лимита по времени в 30 минут?
- а) запуск падает с ошибкой, метрика не считается, попытка не списывается;
- б) процесс убивают, и метрика считается по тому, что уже записано в --output;
- в) что-то другое.
2. Можно ли узнать фактическое время работы запуска (хотя бы общее время стадии инференса) и видеть precision и recall не только для лучшего сабмита? Сейчас для нелучших запусков виден только F1, и непонятно, упало ли качество из-за модели или из-за нехватки времени.
0
19 сентября
А
2. Наведи левее на звездочки. А время ток ручками считац
1
20 сентября
Спасибо) Оч выручил!
0
20 сентября
В описание задачи (обзоре) и в примерах разный формат данных
| `⟦ASSISTANT · ход N⟧` | в описании без номера хода |
| `→ TOOL_CALL X: {...}` | в описании как `⟦TOOL_CALL name="X"⟧` |
| `← TOOL_RESPONSE X: ...` | в описании как `⟦TOOL_RESULT name="X"⟧` |в проверяющей системе будет, так как в примерах или как в описании задачи? или возможны оба варианта?
0
21 сентября
Примерам верить
0
20 сентября
Загрузка файлов не работает - доходит до почти до 90% и куда то пропадает окно загрузки
0
20 сентября
Брат, мой скрипт от ХипонгаНаКиреешках лежит выше. Воспользуйся. Можешь закинуть в ИИшку, спросив, нет ли малваря/стилинга.
Спойлер: нет, но проверить не лишним
0
21 сентября
Да, перечитал тред, получается загрузка глючит у всех и за 2 недели никто так и не починил. Еще там куча каких-то свистелок крутится бесполезных и сжирающих VRAM, у меня гипотеза что бесполезные свистелки крашатся. Еще пайплайн запускается с третьей попытки и после обновления страницы - но тем не менее пишет, что успешно запущен даже когда ничего не запущено.
0
22 сентября
@blanda7513 Уважаемые организаторы! Вы вообще проверяли свою страницу загрузки она загружает через раз и падает в конце после того как больше часа передает данные
там минимум несколько глюков с исчезающим попапом, с тем что загруженный файл пропадает прямо в попапе, с тем что кнопка запуска ничего не делает, но говорит что успешно запустилось - в итоге надо страницу перезагружать перед тем как нажимать на кнопку
итого дай Бог 1/5 загрузок работает - в итоге весь канал забит и 200кб сек
0
20 сентября
Напишите пожалуйста sha256 файлов baseline.tar.gz
0
21 сентября
А бейзлайн решение это? (на текущий момент 14 место)?
F1 = 0.48958 Precision=0.37008 Recall=0.72308
1
22 сентября
Да
0
21 сентября
Здравствуйте! Сабмит проходит все этапы до «22. Статус расчёта метрик (Code run)» и падает там; логи этапа 22 не скачиваются. Уточните, пожалуйста: (1) какой формат файла предсказаний ждёт скорер — имена и типы колонок, порядок строк, кодировка, разделитель строк; (2) читает ли скорер файл по пути --output или ожидает фиксированное имя в рабочей директории; (3) можно получить текст ошибки этапа 22? Спасибо!
0
21 сентября
Нужно в Parquet, а не csv
0
21 сентября
Нужно ли включать веса baseline-модели в model/, или они уже доступны в среде запуска?
Ответ может достигать объема - до 40 Гб?
0
22 сентября
В среде нет ничего связанного с решением, поэтому нужно.
0
22 сентября
будет запись вебинара?
0
22 сентября
да, сказали, что будет
2
23 сентября
Здравствуйте, уточните, пожалуйста, два момента:
Ограничение "размер решения строго менее 40 ГБ" относится к загружаемому архиву или к сумме распакованных файлов? Учитываются ли зависимости вместе с весами и кодом?
Ранее на вопрос об интернете на шаге pip install . был ответ "Нет доступа". Это относится ко всему циклу проверки, включая подготовку и загрузку модели? Веса обязательно должны находиться в архиве или их разрешено скачивать из Hugging Face при подготовке?
1
23 сентября
Уважаемые организаторы, большая просьба вылодите запись вединара плиз
9
27 сентября
Как же им по....
2
24 сентября
Здравствуйте! Подтвердите, пожалуйста, что ограничение «размер решения строго менее 40 ГБ» проверяется по загружаемому ZIP-архиву, а не по суммарному объёму файлов на диске после распаковки. Мой ZIP имеет размер 39,93 ГБ; при запуске он дополнительно распаковывает вложенный runtime, и суммарный объём становится около 41,01 ГБ. Такое решение соответствует лимиту?
1
28 сентября
Здравствуйте. Соответствует.
0
24 сентября
Напишите пожалуйста sha256 файлов baseline.tar.gz, Я не могу понять какой из файлов у меня скачивается с ошибкой. Не распаковывается
0
28 сентября
% sha256sum baseline.tar.gz.*
d7e5e2e8a77a08de87d815614ec3a2e4cf3ccc3491925430943b90e96f6764d2 baseline.tar.gz.00
9c3b57335d99de6b85e94156589babeab9cdf349b41d315bb1b9097c51936517 baseline.tar.gz.01
c4144a01fb8fa661f5ab95cd225601e9676c632badda14944e7a657ccfdbba97 baseline.tar.gz.02
5fcd652cc2bba08fd8123c423d0331e6a7e4f94038fedf85e1970b9115921909 baseline.tar.gz.03
2b27de1289071a3d5fed12bec134a350f4cc870198156a4e3b4b2c84ae3521fa baseline.tar.gz.04
5043bcc5149cd5428f4514c842d73252cba581e17a29e1ddee012fdc44e65904 baseline.tar.gz.05
9569a61b78747b20fae2f9ca9fac7a0db93f4eb90813e6a5c4c23e12a8a31cd4 baseline.tar.gz.06
0
29 сентября
Добрый день,
А записи вэбинара от 22 сентября в 16:00 (по московскому времени) случайно нет?
Заренее спасибо.
6
2 октября
Добрый день! Есть ли в окружении платформы предустановленная модель Qwen3.6-35B-A3B-FP8 (или аналогичная LLM) для инференса? Или решение должно содержать веса модели в архиве?
0
3 октября
По идее весов нет. А вот wheels, которые нужны под модель - есть. Были косяки с этим у меня.
Но надеюсь, организаторы поправят
0
3 октября
Независимые решения, полное совпадение. Глюк платформы?
0
5 октября
вы NSU-TEAM ?
0
5 октября
Сэмплов мало, метрика простая. Поэтому совпадения скора вполне вероятны.
1 место — yost49158127
```
F1: 0.61091
Precision: 0.57931
Recall: 0.64615
TP: 84
FP: 61
FN: 46
TN: 357
Predicted positive: 145
Predicted negative: 403
```
2 место — NSU-TEAM
и
3 место — ❄️ Cole Palmer ❄️
```
F1: 0.60976
Precision: 0.64655
Recall: 0.57692
TP: 75
FP: 41
FN: 55
TN: 377
Predicted positive: 116
Predicted negative: 432
```
0
7 октября
ПОЛНОЕ совпадение всех метрик на границе 1-2 дней - это обмен решениями, либо сбой сервера (решения не прошли и им записались одни результаты).
Можно образы сравнить.
Я вижу так: кто-то случайно перелогинился и залил одно и то же решение. В положении про это написано однозначно.
1
4 октября
Hello!
Does Guardian of Truth support submitting a Docker image reference from a container registry, as Green Challenge does, instead of uploading a ZIP archive?
If not, could you consider adding this option? When model weights remain unchanged and only inference code or prompts are updated, uploading the full archive again consume substantial bandwidth and time. A registry-based workflow would let us reuse unchanged model layer.
0
4 октября
Очень жаль, что приходится сначала качать веса, потом их грузить. Со 2ой задачей моя машинка, при качестве связи в Крыму, отказывается справляться. Могу только эвристики править. Удачи всем участникам!
0
5 октября
Здравствуйте! На какую почту можно написать с вопросом о задаче? На прикрепленную на сайт хакатона почту (AIJContest_2026_org@sberbank.ru) не получается отправить письмо.
0
5 октября
В политике некоторых доменов указано «You should only make one tool call at a time». Если ответ одного хода содержит несколько вызовов, каждый из которых корректен по аргументам, доступности и условиям политики, считается ли само количество вызовов основанием для метки 1? Или ограничение относится к фактическому одновременному исполнению, которое нельзя установить по записи диалога?
0
6 октября
Лимит 30 минут действует на один прогон по всему тесту (публичная + приватная часть вместе) или на каждую часть отдельно? И публичный скор считается из того же прогона, что и приватный?
1
9 октября
Здравствуйте! Вопрос по окружению инференса решений.
Из логов прогона видно, что решение запускается на A100 (sm80) с vLLM 0.19.1, при этом зависимости из pyproject.toml решения не устанавливаются (в логе нет шага pip install; у нас в зависимостях закреплён vllm==0.30.0).
Наше решение использует LoRA-адаптер поверх FP8 MoE-модели (runtime-LoRA, --enable-lora). На связке «A100 + vLLM 0.19.1» движок падает при инициализации:
triton.compiler.errors.CompilationError: fused_moe_kernel ...
ValueError: type fp8e4nv not supported in this architecture
Фикс появился в vLLM начиная с релизов ~0.24 (FP8 MoE + LoRA роутится на Marlin), у нас это проверено на 0.30.0.
Подскажите, пожалуйста:
Можно ли обновить vLLM в окружении инференса до версии из зависимостей решения (0.30.0) — или выполнять pip install . с установкой зависимостей из pyproject.toml?
Если обновление невозможно — можно ли выполнять инференс на GPU с аппаратной поддержкой FP8?
0
9 октября
Вопрос про приватному набору сейчас и в финале.
1. Разметка набора следует тому же стандарту, что ваш публичный сэмпл, или включает расширенные сценарии(т3) на человечность? Вы будете модифицировать задачи генератором или усложнять их?
2. Не совсем понятно про галлюцинации. Если текст/рассуждения неверны, а действие - верное, то это неподкреплённость(галлюцинация) или нет?
0
вчера
10.10.2026 18:13
Запустил, закончилось ошибкой, локально ок.
Подскажите пожалуйста в чем именно ошибка.
0