subochev 0ba9b7d739 feat: экспоненциальный backoff (providers[].backoff / upstreams[].backoff)
Повторяющиеся сбои апстрима (5xx/429/402 и сетевые ошибки) увязываются
экспоненциальным откатом: первая ошибка — отдых 1s, далее 2s, 4s, … до
потолка из конфига (ISO-8601: P1M, PT15M…); успешный запрос сбрасывает
счётчик. Приоритет: upstreams[].backoff (свой счётчик на модель) над
providers[].backoff (общий счётчик на все модели провайдера).

- Backoff.kt: BackoffGuard (Mutex/@Volatile, kotlinx-datetime) +
  BackoffRegistry (скоупы провайдер/модель);
- pickFreeUpstream пропускает апстримы в откате (лог «~Ns — пропускаю»);
- все апстримы модели в откате → 503 «all upstreams cooling, retry in Ns»
  + заголовок Retry-After;
- некорректный ISO-8601 в backoff — warn + игнор поля;
- BackoffTest (8 тестов) + обновлённые тесты pickFreeUpstream;
- CONFIG.md/README/TESTING.md. Проверено: jvmTest, compileKotlinLinuxX64,
  linuxX64Test.
2026-09-13 20:33:36 +03:00
fix
2026-08-30 14:06:35 +03:00

llm-proxy

Прозрачная прослойка/роутер OpenAI API. Принимает /v1/chat/completions и /v1/models, маршрутизирует между объявленными в YAML апстримами по внутреннему учёту конкурентности и мержит patch-слои (provider → upstream → model) в тело запроса. Подробная спецификация конфига — в CONFIG.md.

Конфиг

Конфигурация — в YAML-файле (по умолчанию config.yaml в каталоге проекта, CWD; переопределяется env CONFIG_PATH). Блоки: server (интерфейс биндинга host + port, дефолты 0.0.0.0 / 8100), providers, upstreams, models. Старый механизм env-переменных (UPSTREAM_URL, ROUTER_API_KEY, EXCLUDED_PROVIDERS, THINKING_MODELS, PORT) удалён — его поведение теперь в декларативном patch и блоке upstreams, а порт/интерфейс — в блоке server.

Лимит конкурентности max_concurrency можно задать и на провайдере (лимит по умолчанию для его апстримов), и на апстриме (перекрывает провайдерский); без обоих — безлимит.

Обработку think-тегов включает опциональный флажок think_tags у провайдера или апстрима (off по умолчанию, split — рассуждения из think-тегов уходят в reasoning_content, strip — выбрасываются); работает и в стриме, и в non-stream.

Повторяющиеся сбои апстрима увязываются экспоненциальным backoff: поле backoff (ISO-8601-потолок, напр. P1M) задаётся на провайдере (общий счётчик на его модели) и/или на апстриме (приоритет). Первая ошибка — отдых 1s, далее 2s, 4s, … до потолка; успех сбрасывает. Все апстримы модели в откате — 503 с Retry-After.

Переменная Default Описание
CONFIG_PATH config.yaml (CWD) Путь к YAML-конфигу
Ключ конфига Default Описание
server.host 0.0.0.0 Интерфейс/адрес биндинга
server.port 8100 Порт сервера

Таймаут на запрос к нейронке (весь ответ, включая стриминг) — константа UPSTREAM_REQUEST_TIMEOUT_MS = 5 минут; без неё дефолт CIO-движка Ktor — 15 секунд, и длинные генерации обрываются. Значение логируется при старте.

Сборка и деплой

  • CI (Gitea Actions, на release): ./gradlew fatJar → образ images.binom.pw/llm-proxy:<tag> (zot).
  • Запуск на 76.179 (llm-router): podman-compose up -d из podman-compose.yaml (образ тянется из images.binom.pw, сеть bifrost_default — туда же Bifrost ходит по имени llm-proxy).
  • Bifrost: в config_providers провайдера Routerai network_config_json.base_url = http://llm-proxy:8100 (после смены — рестарт bifrost_gateway).
S
Description
OpenAI-прослойка перед RouterAI (provider.ignore + no-think)
Readme 625 KiB
14 Latest
2026-09-14 22:06:15 +00:00
Languages
Kotlin 99.9%