feat/aitunnel-models - #7
Merged
Merged
Conversation
Дефолт max_tokens поднят с 4096 до 16384: у reasoning-моделей рассуждение расходует выходной бюджет, и на 4096 код обрывался. Не-reasoning модели не затронуты — заканчивают ответ раньше потолка. Добавлены модели через AITUNNEL (OpenAI-совместимый шлюз, канал openai_compat): OpenAI GPT-5.5, GPT-5 Mini, GPT-OSS 120B; Google Gemini 3.1 Pro, Gemini 3.5 Flash. Цены — в pricing.yaml (тариф aitunnel в рублях ÷ ~85).
Генерации и L1-оценки новых моделей (GPT-5.5/5-mini/OSS-120B, Gemini 3.1 Pro/ 3.5 Flash) дозаписаны в рулоны и auto_l1 обоих экспериментов. Прежние модели не пересчитывались. Категория A: Gemini 3.5 Flash и 3.1 Pro делят топ; категория B: Gemini 3.5 Flash #1, но 3.1 Pro проседает (галлюцинирует схему метаданных).
Таблицы и бейджи пересобраны командой prism docs из results/auto/ — добавлены пять моделей AITUNNEL в сводную, по-категорийные и pass-rate таблицы.
Патч-релиз: метрика и банк задач не менялись, оценки из 1.3.0 сравнимы напрямую. Версия в pyproject/CITATION/uv.lock + запись в CHANGELOG.
Первый (сводный) лидерборд сортировался по доле решённых только категории A, из-за чего сильные в алгоритмике, но беспомощные на платформе 1С модели висели вверху (Gemini 3.1 Pro: #2 при 0% по B). Таблица отвечает «кто лучше в целом», поэтому сортируем по среднему A и B. Ячейки A/B остаются раздельными. Sonnet 4.6 поднялся на #3 (B 80%), Gemini 3.1 Pro опустился на #5.
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
Что это
Релиз 1.3.1. Подключены зарубежные модели через OpenAI-совместимый шлюз AITUNNEL
и устранена обрезка reasoning-моделей по выходному бюджету. Метрика SMOP и банк
задач не менялись — оценки из 1.3.0 сравнимы напрямую (патч).
Добавлено
Пять моделей через AITUNNEL (канал
openai_compat, endpoint вmodels.yaml,ключ
OPENAI_COMPAT_API_KEY) — нового адаптера не потребовалось:Цены — в
generation/pricing.yaml(рублёвый тариф aitunnel ÷ ~85 ₽/$).Исправлено
params.yaml → max_tokensподнят с 4096до 16384. У reasoning-моделей рассуждение расходует выходной бюджет, и на 4096
код обрывался (пустой/неполный ответ). Не-reasoning модели не затронуты —
заканчивают ответ раньше потолка.
решённых только категории A, из-за чего сильные в алгоритмике, но беспомощные
на платформе 1С модели висели вверху (Gemini 3.1 Pro: build(deps): bump pydantic-settings from 2.14.1 to 2.14.2 in the uv group across 1 directory #2 при 0% по B). Теперь
сортировка — по среднему A и B; ячейки A/B остаются раздельными.
Результаты (20 моделей: A — 9 задач, B — 15)
не-Anthropic модель, реально знающая платформу 1С.
B 0% («нет такого поля или объекта» ×15): пишет идеальный по синтаксису BSL,
ссылаясь на несуществующие метаданные.
Заметки
yandex_responses: через aitunnelreasoning не глушится, агентный сбор метаданных в кат. B падает.
max_tokens=16384шлюзпредоценивает дорогой запрос в ~половину макс. выхода и режет HTTP 402 —
для дорогих моделей держать бюджет ключа с запасом.
Checks
prism docsпересобрал README / docs/leaderboard.md / docs/status.md изresults/auto/.