Upgrade litert-api/litert-google/litert-openai to v7 (litertlm-jvm 0.17.0), drop workarounds

This commit is contained in:
2026-09-13 14:46:09 +03:00
parent 9e5d61707d
commit afdfb37e35
6 changed files with 13 additions and 39 deletions
+5 -9
View File
@@ -1,6 +1,6 @@
# Standalone — рантайм агента agentik
`standalone` — это исполняемое JVM-приложение (точка входа `pw.binom.agentik.standalone.MainKt`), которое поднимает реальный агент `ChatAgent` (stateful, SQLite-персистентный) и навешивает на него HTTP+SSE фасад `:server`. LLM-движок выбирается через `AGENTIK_LLM_BACKEND` — на v1 поддерживаются `litert-openai` (любой OpenAI-совместимый endpoint) и `litert-google` (on-device движок LiteRT-LM 0.16.1 через нативную `.so`-библиотеку).
`standalone` — это исполняемое JVM-приложение (точка входа `pw.binom.agentik.standalone.MainKt`), которое поднимает реальный агент `ChatAgent` (stateful, SQLite-персистентный) и навешивает на него HTTP+SSE фасад `:server`. LLM-движок выбирается через `AGENTIK_LLM_BACKEND` — на v1 поддерживаются `litert-openai` (любой OpenAI-совместимый endpoint) и `litert-google` (on-device движок LiteRT-LM 0.17.0 через нативную `.so`-библиотеку из litertlm-jvm 0.17.0).
Этот документ описывает, как `standalone` собран и как его расширять.
@@ -209,7 +209,7 @@ suspend fun touch(id: String, now: Instant)
`LlmConfig.fromEnv()` парсит env, валидирует обязательные поля и выбирает бэкенд через `AGENTIK_LLM_BACKEND`:
- `openai` (default) — `litert-openai`, текст-онли чат против любого OpenAI-совместимого endpoint.
- `google` — `litert-google` (LiteRT-LM 0.16.1, on-device `.task`/`.litertlm` модель, требует нативной библиотеки через `litertlm-jvm`).
- `google` — `litert-google` (LiteRT-LM 0.17.0, on-device `.task`/`.litertlm` модель, требует нативной библиотеки через `litertlm-jvm`).
### Общие env
@@ -238,15 +238,11 @@ suspend fun touch(id: String, now: Instant)
`AGENTIK_DB_PATH=:memory:` создаёт in-memory БД (только для тестов и интеграционных проверок).
### Long-lived LiteConversation — ОБЯЗАТЕЛЬНО для google
### Long-lived LiteConversation — ОБЯЗАТЕЛЬНО для обоих бэкендов
`LiteConversation` от любого litert-бэкенда — это **долгоживущая stateful ручка**: она держит историю сообщений и (для google) KV-cache/sampler-state. На v1 `ChatConversation` создаёт `LiteConversation` один раз (на первом `send`) и переиспользует на всех последующих turn'ах той же беседы. Пересоздание LiteConversation на каждый send ломает KV-cache для google (и в v1 приводит к ошибке chat template «roles must alternate» после двух user-сообщений).
`LiteConversation` от любого litert-бэкенда — это **долгоживущая stateful ручка**: она держит историю сообщений и (для google) KV-cache/sampler-state. `ChatConversation` создаёт `LiteConversation` один раз (на первом `send`) и переиспользует на всех последующих turn'ах той же беседы. Пересоздание LiteConversation на каждый send ломает KV-cache для google (LiteRT-LM 0.17.0 умеет правильно восстанавливать state при `systemInstruction + пары User/Assistant` в `initialMessages`).
`AGENTIK_GOOGLE_FOLD_SYSTEM_INTO_FIRST_USER` (default `true` для google) — фолдит системный промпт в первое user-сообщение, чтобы движок увидел только `[User+system, Assistant, User, ...]` и не падал на alternation. Для openai этот режим отключён.
### Workaround для litert-google-jvm 0.16.1
Баг в `sendStreamContents` — поток не закрывается после `isDone = true`. `ChatConversation` оборачивает стрим в `transformWhile { !delta.isDone }`, поэтому SSE получает корректный `End` event.
`LiteLlm.capabilities: LiteCapabilities?` (litert-api 7+) — `litert-google` читает из заголовка on-disk модели (text/vision/audio, supportsThinking, supportsFunctionCalling, maxVisionTokenBudget); `litert-openai` возвращает `null` (модель не хранится на диске). Используй для фильтрации модальностей в клиенте.
---
+1 -1
View File
@@ -6,7 +6,7 @@ kotlinx-datetime = "0.8.0"
ktor = "3.1.3"
agui = "0.1.0"
a2a = "1.0.0-SNAPSHOT"
litert = "6"
litert = "7"
sqldelight = "2.3.2"
[plugins]
@@ -71,7 +71,7 @@ class ChatAgent(
)
}
}
val conv = ChatConversation(record = rec, stores = stores, llm = llm, systemPrompt = llmConfig.systemPrompt, foldSystemIntoFirstUser = llmConfig.foldSystemIntoFirstUser)
val conv = ChatConversation(record = rec, stores = stores, llm = llm, systemPrompt = llmConfig.systemPrompt)
runBlocking {
liveLock.withLock { live[conv.id] = conv }
}
@@ -82,7 +82,7 @@ class ChatAgent(
override suspend fun getConversation(id: String): ProtoConversation? {
liveLock.withLock { live[id] }?.let { if (!it.isClosed) return it }
val rec = stores.conversations.get(id) ?: return null
return ChatConversation(record = rec, stores = stores, llm = llm, systemPrompt = llmConfig.systemPrompt, foldSystemIntoFirstUser = llmConfig.foldSystemIntoFirstUser).also {
return ChatConversation(record = rec, stores = stores, llm = llm, systemPrompt = llmConfig.systemPrompt).also {
liveLock.withLock { live[id] = it }
}
}
@@ -9,7 +9,6 @@ import kotlinx.coroutines.channels.BufferOverflow
import kotlinx.coroutines.flow.Flow
import kotlinx.coroutines.flow.MutableSharedFlow
import kotlinx.coroutines.flow.asSharedFlow
import kotlinx.coroutines.flow.transformWhile
import kotlinx.coroutines.launch
import kotlinx.coroutines.sync.Mutex
import kotlinx.coroutines.sync.withLock
@@ -59,7 +58,6 @@ class ChatConversation(
private val stores: SqliteStores,
private val llm: LiteLlm,
private val systemPrompt: String,
private val foldSystemIntoFirstUser: Boolean = false,
) : ProtoConversation, AutoCloseable {
private var record: ConversationRecord = record
@@ -184,12 +182,7 @@ class ChatConversation(
val reply = StringBuilder()
try {
// Некоторые бэкенды (litert-google-jvm 0.16.1) не закрывают стрим после `isDone = true`,
// поэтому заворачиваем в transformWhile: видим isDone → отдаём дельту и завершаем flow.
liteConv.sendStreamContents(parts).transformWhile { delta ->
emit(delta)
!delta.isDone
}.collect { delta ->
liteConv.sendStreamContents(parts).collect { delta ->
if (delta.text.isNotEmpty()) {
reply.append(delta.text)
emitEvent(ProtoEvent.AppendText(date = now(), body = delta.text))
@@ -238,9 +231,6 @@ class ChatConversation(
* уже записанное в audit + working memory, но ещё не отправленное в LLM — мы отдадим
* его через [LiteConversation.sendStreamContents]). Это предотвращает дублирование
* "user → user" в LiteConversation history.
*
* Если [foldSystemIntoFirstUser] — система не передаётся как `systemInstruction`,
* а фолдится в первое user-сообщение (нужно для Gemma-3 шаблона LiteRT-LM 0.16.1).
*/
private suspend fun getOrCreateLiteConversation(excludeUserSourceId: String? = null): LiteConversation {
liteConv?.let { return it }
@@ -268,21 +258,8 @@ class ChatConversation(
}
val config = LiteConversationConfig(
systemInstruction = if (foldSystemIntoFirstUser) null else resolvedSystemPrompt.takeIf { it.isNotBlank() },
initialMessages = if (foldSystemIntoFirstUser) {
val firstUser = pastTurns.firstOrNull { it.role == LiteRole.USER }
if (firstUser != null && resolvedSystemPrompt.isNotBlank()) {
val folded = LiteMessage(
role = LiteRole.USER,
contents = listOf(LiteContentPart.Text(resolvedSystemPrompt + "\n\n")) + firstUser.contents,
)
listOf(folded) + pastTurns.drop(1)
} else {
pastTurns
}
} else {
pastTurns
},
systemInstruction = resolvedSystemPrompt.takeIf { it.isNotBlank() },
initialMessages = pastTurns,
)
return llm.createConversation(config).also { liteConv = it }
@@ -12,7 +12,6 @@ data class LlmConfig(
val systemPrompt: String,
val openai: LitertOpenAiConfig? = null,
val google: GoogleConfig? = null,
val foldSystemIntoFirstUser: Boolean = backend == LlmBackend.GOOGLE,
) {
init {
when (backend) {
@@ -326,6 +326,7 @@ class ChatAgentTest {
private fun fakeLiteLlmForReload(): LiteLlm = object : LiteLlm {
override val backendName: String = "fake"
override val capabilities: pw.binom.litert.LiteCapabilities? = null
override fun isInitialized(): Boolean = true
override fun createConversation(config: LiteConversationConfig): LiteConversation =
error("not used in reload test")
@@ -357,6 +358,7 @@ class ChatAgentTest {
/** Поддельный LiteLlm: возвращает fakeLlm.reply в sendStreamContents, опционально запоминает history. */
private class FakeLiteLlm : LiteLlm {
override val backendName: String = "fake"
override val capabilities: pw.binom.litert.LiteCapabilities? = null
var reply: String = ""
var rememberHistory: Boolean = false
var slow: Boolean = false