subochev 8154485b3b
Build LLM Proxy / Build and push (release) Successful in 39s
feat: нативное поле рассуждений (reasoning_field) — правка 400 от Console Go
Диагноз: апстрим deepseek-v4.1-flash (провайдер opencode, Console Go) в thinking-режиме
требует reasoning_content в assistant-сообщениях с tool_calls, а клиент opencode
присылает рассуждения как reasoning + reasoning_details. Отсюда 400
'The reasoning_content in the thinking mode must be passed back to the API'.

- providers[].reasoning_field / reasoning_empty_ok: прокси аддитивно достраивает
  нативное поле в assistant-сообщениях с непустым tool_calls (текст из reasoning
  или reasoning_details[].text, тип reasoning.text); существующее непустое поле
  не перезаписывается, ничего не переименовывается, прочие сообщения не трогаются;
- устойчивость разбора ответов к JSON-null (choices/delta/content/tool_calls) —
  было 290 фейловеров с локального апстрима на платные из-за нашего же исключения;
- лог: класс исключения в сообщении об ошибке; для 4xx логируется тело ответа
  апстрима (читается безопасно: 4xx — не стрим);
- тесты: ReasoningFieldTest (13), NullToleranceTest (6), ConfigLogicTest (+2) — 100 всего;
- CONFIG.md, TESTING.md (фактические замеры A/B против Console Go).
2026-09-12 23:46:42 +03:00
fix
2026-08-30 14:06:35 +03:00

llm-proxy

Прозрачная прослойка/роутер OpenAI API. Принимает /v1/chat/completions и /v1/models, маршрутизирует между объявленными в YAML апстримами по внутреннему учёту конкурентности и мержит patch-слои (provider → upstream → model) в тело запроса. Подробная спецификация конфига — в CONFIG.md.

Конфиг

Конфигурация — в YAML-файле (по умолчанию config.yaml в каталоге проекта, CWD; переопределяется env CONFIG_PATH). Блоки: server (интерфейс биндинга host + port, дефолты 0.0.0.0 / 8100), providers, upstreams, models. Старый механизм env-переменных (UPSTREAM_URL, ROUTER_API_KEY, EXCLUDED_PROVIDERS, THINKING_MODELS, PORT) удалён — его поведение теперь в декларативном patch и блоке upstreams, а порт/интерфейс — в блоке server.

Лимит конкурентности max_concurrency можно задать и на провайдере (лимит по умолчанию для его апстримов), и на апстриме (перекрывает провайдерский); без обоих — безлимит.

Обработку think-тегов включает опциональный флажок think_tags у провайдера или апстрима (off по умолчанию, split — рассуждения из <think>…</think> уходят в reasoning_content, strip — выбрасываются); работает и в стриме, и в non-stream.

Переменная Default Описание
CONFIG_PATH config.yaml (CWD) Путь к YAML-конфигу
Ключ конфига Default Описание
server.host 0.0.0.0 Интерфейс/адрес биндинга
server.port 8100 Порт сервера

Таймаут на запрос к нейронке (весь ответ, включая стриминг) — константа UPSTREAM_REQUEST_TIMEOUT_MS = 5 минут; без неё дефолт CIO-движка Ktor — 15 секунд, и длинные генерации обрываются. Значение логируется при старте.

Сборка и деплой

  • CI (Gitea Actions, на release): ./gradlew fatJar → образ images.binom.pw/llm-proxy:<tag> (zot).
  • Запуск на 76.179 (llm-router): podman-compose up -d из podman-compose.yaml (образ тянется из images.binom.pw, сеть bifrost_default — туда же Bifrost ходит по имени llm-proxy).
  • Bifrost: в config_providers провайдера Routerai network_config_json.base_url = http://llm-proxy:8100 (после смены — рестарт bifrost_gateway).
S
Description
OpenAI-прослойка перед RouterAI (provider.ignore + no-think)
Readme 625 KiB
14 Latest
2026-09-14 22:06:15 +00:00
Languages
Kotlin 99.9%