Files
OmniRoute/open-sse/handlers/usageExtractor.ts
Praveen K Palaniswamy 65e81158ab fix(ollama): route models by advertised capability (#11088)
Landed with the design call resolved per the owner's pick — **option 1**: the synced store is now endpoint-agnostic (persistDiscoveredModels and managedModelImport no longer drop non-chat models at write time), and chat selectability moved to read time (auto-pool expansion in autoStrategy applies filterChatSelectableModels; the models-route projection already had its chatOnly filter). Your discovery test now passes end-to-end (3/3): /api/show capabilities persist per connection and image/embedding requests route through the advertising host.

Reconciliation notes: conflicted areas merged onto the current tip (adobe discovery import, requestedModel preflight signature, resolvedProvider fast-path coexists with the synced-route override — explicit resolution wins); carried base-red drains (#10055 memoization, #11071 test variants) dropped as already-landed; the managed-model-import exclusion test was propagated to the new contract (image/video models persist; the read filter still hides them from chat pickers — pinned by a new assertion). Full battery: 205/206 focused (the one red is a confirmed periodic-timer timing flake on the loaded devbox — 20/20 isolated), autoCombo vitest 30/30, combo suites 46/46, gates + typecheck clean.

Thank you @yourspraveen — the capability probe + routing design was right; it just needed the store contract opened up. Fixes #11087.
2026-08-23 11:45:01 -03:00

114 lines
4.9 KiB
TypeScript

/**
* Extract usage from non-streaming response body
* Handles different provider response formats
*/
export function extractUsageFromResponse(responseBody, provider) {
if (!responseBody || typeof responseBody !== "object") return null;
const providerId = typeof provider === "string" ? provider.toLowerCase() : "";
const isClaudeProvider =
providerId === "claude" ||
providerId === "anthropic" ||
providerId.startsWith("anthropic-compatible");
// OpenAI format (has prompt_tokens / completion_tokens)
if (
responseBody.usage &&
typeof responseBody.usage === "object" &&
responseBody.usage.prompt_tokens !== undefined
) {
return {
prompt_tokens: responseBody.usage.prompt_tokens || 0,
completion_tokens: responseBody.usage.completion_tokens || 0,
// DeepSeek native API uses flat prompt_cache_hit_tokens (NOT
// prompt_tokens_details.cached_tokens). Fall back to it so V4 cache
// gets surfaced into kanban call_logs alongside the OpenAI/Claude paths.
cached_tokens:
responseBody.usage.prompt_tokens_details?.cached_tokens ??
responseBody.usage.input_tokens_details?.cached_tokens ??
responseBody.usage.prompt_cache_hit_tokens ??
responseBody.usage.cached_tokens ??
responseBody.usage.cache_read_input_tokens,
reasoning_tokens:
responseBody.usage.completion_tokens_details?.reasoning_tokens ??
responseBody.usage.output_tokens_details?.reasoning_tokens ??
responseBody.usage.reasoning_tokens,
// xAI's exact provider-reported cost (port of decolua/9router#2453, capability A —
// @ryanngit). Only set the key when present so non-xAI OpenAI-shaped usage
// (Codex, DeepSeek, etc.) is unaffected. Ticks → USD conversion happens in
// costCalculator.ts, not here.
...(typeof responseBody.usage.cost_in_usd_ticks === "number" &&
Number.isFinite(responseBody.usage.cost_in_usd_ticks) &&
responseBody.usage.cost_in_usd_ticks >= 0
? { cost_in_usd_ticks: responseBody.usage.cost_in_usd_ticks }
: {}),
};
}
// Claude format
if (
isClaudeProvider &&
responseBody.usage &&
typeof responseBody.usage === "object" &&
(responseBody.usage.input_tokens !== undefined ||
responseBody.usage.output_tokens !== undefined)
) {
const inputTokens = responseBody.usage.input_tokens || 0;
const cacheRead = responseBody.usage.cache_read_input_tokens || 0;
const cacheCreation = responseBody.usage.cache_creation_input_tokens || 0;
// Total prompt tokens = input + cache_read + cache_creation (per Claude API docs)
const promptTokens = inputTokens + cacheRead + cacheCreation;
return {
prompt_tokens: promptTokens,
completion_tokens: responseBody.usage.output_tokens || 0,
cache_read_input_tokens: cacheRead,
cache_creation_input_tokens: cacheCreation,
...(typeof responseBody.usage.output_tokens_details?.thinking_tokens === "number"
? { reasoning_tokens: responseBody.usage.output_tokens_details.thinking_tokens }
: {}),
};
}
// OpenAI Responses API format (input_tokens / output_tokens)
const responsesUsage = responseBody.response?.usage || responseBody.usage;
if (
responsesUsage &&
typeof responsesUsage === "object" &&
(responsesUsage.input_tokens !== undefined || responsesUsage.output_tokens !== undefined)
) {
return {
prompt_tokens: responsesUsage.input_tokens || 0,
completion_tokens: responsesUsage.output_tokens || 0,
cache_read_input_tokens: responsesUsage.cache_read_input_tokens,
cached_tokens:
responsesUsage.input_tokens_details?.cached_tokens ??
responsesUsage.prompt_tokens_details?.cached_tokens ??
responsesUsage.cache_read_input_tokens,
cache_creation_input_tokens: responsesUsage.cache_creation_input_tokens,
reasoning_tokens:
responsesUsage.output_tokens_details?.reasoning_tokens ??
responsesUsage.completion_tokens_details?.reasoning_tokens ??
responsesUsage.reasoning_tokens,
};
}
// Gemini format. Antigravity / gemini-cli wrap the payload in
// { response: { ... } } — read the envelope so non-streaming requests do
// not silently log zero usage (port of decolua/9router#59d858b).
const usageMetadata = responseBody.usageMetadata || responseBody.response?.usageMetadata;
if (usageMetadata && typeof usageMetadata === "object") {
// Gemini reports thoughts outside candidates. Fold them into completion so
// every provider keeps reasoning as a subset of completion tokens.
const thoughts = usageMetadata.thoughtsTokenCount || 0;
return {
prompt_tokens: usageMetadata.promptTokenCount || 0,
completion_tokens: (usageMetadata.candidatesTokenCount || 0) + thoughts,
cached_tokens: usageMetadata.cachedContentTokenCount || 0,
reasoning_tokens: thoughts,
};
}
return null;
}