Skip to content

feat/aitunnel-models - #7

Merged
4dand merged 5 commits into
mainfrom
feat/aitunnel-models
Jun 27, 2026
Merged

feat/aitunnel-models#7
4dand merged 5 commits into
mainfrom
feat/aitunnel-models

Conversation

@4dand

@4dand 4dand commented Jun 27, 2026

Copy link
Copy Markdown
Member

Что это

Релиз 1.3.1. Подключены зарубежные модели через OpenAI-совместимый шлюз AITUNNEL
и устранена обрезка reasoning-моделей по выходному бюджету. Метрика SMOP и банк
задач не менялись — оценки из 1.3.0 сравнимы напрямую (патч).

Добавлено

Пять моделей через AITUNNEL (канал openai_compat, endpoint в models.yaml,
ключ OPENAI_COMPAT_API_KEY) — нового адаптера не потребовалось:

  • OpenAI: GPT-5.5, GPT-5 Mini, GPT-OSS 120B
  • Google: Gemini 3.1 Pro, Gemini 3.5 Flash

Цены — в generation/pricing.yaml (рублёвый тариф aitunnel ÷ ~85 ₽/$).

Исправлено

  • Обрезка reasoning-моделей. Дефолт params.yaml → max_tokens поднят с 4096
    до 16384. У reasoning-моделей рассуждение расходует выходной бюджет, и на 4096
    код обрывался (пустой/неполный ответ). Не-reasoning модели не затронуты —
    заканчивают ответ раньше потолка.
  • Сортировка сводного лидерборда. Первая таблица ранжировалась по доле
    решённых только категории A, из-за чего сильные в алгоритмике, но беспомощные
    на платформе 1С модели висели вверху (Gemini 3.1 Pro: build(deps): bump pydantic-settings from 2.14.1 to 2.14.2 in the uv group across 1 directory #2 при 0% по B). Теперь
    сортировка — по среднему A и B; ячейки A/B остаются раздельными.

Результаты (20 моделей: A — 9 задач, B — 15)

  • Gemini 3.5 Flashсhore/release-prep #1 в обеих категориях (A 100%, B 93%); единственная
    не-Anthropic модель, реально знающая платформу 1С.
  • GPT-5.5build(deps): bump pydantic-settings from 2.14.1 to 2.14.2 in the uv group across 1 directory #2 в целом (A 89%, B 73%).
  • Claude Sonnet 4.6 — лучший по платформе после Gemini (B 80%).
  • Показательный кейс: Gemini 3.1 Pro — топ по алгоритмике (A 100%), но
    B 0% («нет такого поля или объекта» ×15): пишет идеальный по синтаксису BSL,
    ссылаясь на несуществующие метаданные.

Заметки

  • qwen3.6 оставлен на родном канале yandex_responses: через aitunnel
    reasoning не глушится, агентный сбор метаданных в кат. B падает.
  • Бюджет ключа aitunnel ≠ баланс счёта. При max_tokens=16384 шлюз
    предоценивает дорогой запрос в ~половину макс. выхода и режет HTTP 402 —
    для дорогих моделей держать бюджет ключа с запасом.

Checks

  • prism docs пересобрал README / docs/leaderboard.md / docs/status.md из
    results/auto/.
  • pre-commit (ruff check+format, commitizen, yaml) — зелёный на всех коммитах.
  • Версия 1.3.1: pyproject / CITATION / uv.lock + CHANGELOG.

4dand added 5 commits June 27, 2026 21:32
Дефолт max_tokens поднят с 4096 до 16384: у reasoning-моделей рассуждение
расходует выходной бюджет, и на 4096 код обрывался. Не-reasoning модели не
затронуты — заканчивают ответ раньше потолка.

Добавлены модели через AITUNNEL (OpenAI-совместимый шлюз, канал openai_compat):
OpenAI GPT-5.5, GPT-5 Mini, GPT-OSS 120B; Google Gemini 3.1 Pro, Gemini 3.5
Flash. Цены — в pricing.yaml (тариф aitunnel в рублях ÷ ~85).
Генерации и L1-оценки новых моделей (GPT-5.5/5-mini/OSS-120B, Gemini 3.1 Pro/
3.5 Flash) дозаписаны в рулоны и auto_l1 обоих экспериментов. Прежние модели не
пересчитывались. Категория A: Gemini 3.5 Flash и 3.1 Pro делят топ; категория B:
Gemini 3.5 Flash #1, но 3.1 Pro проседает (галлюцинирует схему метаданных).
Таблицы и бейджи пересобраны командой prism docs из results/auto/ — добавлены
пять моделей AITUNNEL в сводную, по-категорийные и pass-rate таблицы.
Патч-релиз: метрика и банк задач не менялись, оценки из 1.3.0 сравнимы
напрямую. Версия в pyproject/CITATION/uv.lock + запись в CHANGELOG.
Первый (сводный) лидерборд сортировался по доле решённых только категории A,
из-за чего сильные в алгоритмике, но беспомощные на платформе 1С модели висели
вверху (Gemini 3.1 Pro: #2 при 0% по B). Таблица отвечает «кто лучше в целом»,
поэтому сортируем по среднему A и B. Ячейки A/B остаются раздельными.

Sonnet 4.6 поднялся на #3 (B 80%), Gemini 3.1 Pro опустился на #5.
@4dand
4dand merged commit 3d32589 into main Jun 27, 2026
2 checks passed
@4dand
4dand deleted the feat/aitunnel-models branch June 27, 2026 18:40
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant