Files
OmniRoute/open-sse/services/compression/stats.ts
Diego Rodrigues de Sa e Souza 04af8b1517 feat(compression): adota omniglyph 1.4.0, perfis semânticos e contabilidade com evidência (#10647)
* feat(compression): target-wire OmniGlyph stage and transport fidelity gate

Roda o OmniGlyph depois da tradução para o wire real do provedor, em vez do
corpo de origem. Um cliente OpenAI roteado para Claude deixava de comprimir com
skip:source_format_not_claude porque o corpo ainda estava em formato OpenAI
quando a engine era avaliada.

- dispatch nativo por wire: Anthropic Messages, OpenAI Chat Completions e
  OpenAI Responses (input[] preservado, sem achatar para messages[]);
- estágio target-wire pós-translateRequest, com guarda contra dupla compressão
  no caminho Claude→OpenAI;
- preserveSystemPrompt do OmniRoute mapeado para compressSystem: false;
- imageTransportPolicy: fidelidade de bytes/dimensões separada de supportsVision;
  só Anthropic/Claude tem recibo byte-preserving, o resto é fail-closed;
- contagem de tokens de data URL PNG no wire OpenAI (marcador ;base64,);
- README e i18n en/pt-BR com claims escopados ao caminho medido.

* feat(compression): adota omniglyph 1.4.0 e tira o gate de modelo da env do host

O 1.4.0 introduziu escopos de segurança e passou a resolvê-los dentro de
isOmniGlyphSupportedModel() lendo process.env.OMNIGLYPH_PROFILE. Somado ao
OMNIGLYPH_MODELS que já existia, duas variáveis do ambiente do host decidiam em
silêncio o gate de TODO request do OmniRoute: passthrough desligaria a engine
inteira e OMNIGLYPH_MODELS admitiria modelos sem recibo medido, enquanto a UI
segue prometendo "Claude Fable 5 na rota direta medida".

O adapter passa a usar isOmniGlyphSupportedModelForScope() com escopo explícito
e fixa o escopo mais restrito como teto: a env só pode ESTREITAR a allowlist,
nunca alargar. Os dois wires compartilham a mesma lista no pacote desde o
1.4.0, então uma checagem cobre Anthropic e GPT.

- omniglyph ^1.3.1 -> ^1.4.0 (lock em 1.4.0);
- testes de regressão para os dois caminhos de sequestro por env;
- teste de contrato dos exports novos (escopo, perfis, accounting).

O 1.4.0 também traz, sem mudança de código aqui: correção do glyph K que era
lido como H, remoção do backtracking polinomial no secret-guard, overrides do
pnpm em pnpm-workspace.yaml e as transitivas vulneráveis resolvidas.

* feat(compression): expõe os perfis semânticos do omniglyph nos três wires

O 1.4.0 trouxe perfis nomeados (coding-safe, balanced, aggressive,
passthrough), mas só transformAnthropicMessages() os resolve sozinho: os
transformadores OpenAI recebem TransformOptions cru e ignorariam o campo. Um
perfil escolhido pelo operador valeria no wire Claude e sumiria no OpenAI. O
adapter passa a mesclar o perfil com mergeCompressionProfileOptions() antes de
chamar Chat Completions e Responses.

O default segue aggressive — a política que os recibos publicados mediram.
Medido nesta base: com coding-safe/balanced, uma sessão sem histórico acumulado
para em below_min_chars e a engine não faz nada, porque os dois fixam
minCompressChars no máximo e desligam system/tools/tool-results. Como a engine é
opt-in, um default assim entregaria "ligado, 0% de ganho".

O perfil é TETO, não piso: mergeCompressionProfileOptions não deixa um override
do chamador reabrir uma lane lossy que o perfil fechou. Coberto por teste, por
ser contra-intuitivo.

Também fecha um caminho em que o OmniRoute violaria a própria política: o wire
OpenAI do pacote não tem compressSystem — honra apenas compressTools,
gptHistory, minCompressChars e reflow, e sempre troca a instrução por um
ponteiro para a imagem. Com preserveSystemPrompt ligado, imagear assim queimaria
o prefixo quente que a decisão cache-aware está protegendo, sem nada no corpo
devolvido denunciando. A engine agora pula com
skip:system_preservation_unsupported_on_wire.

* feat(compression): contabilidade física do omniglyph com grau de evidência

O adapter descartava o TransformInfo inteiro, então a UI mostrava um número de
economia sem dizer de onde ele vinha — contagem do provider, estimativa ou só
diferença de bytes. O 1.4.0 expõe normalizeAccounting(), que classifica essa
evidência e resolve a semântica de cache por família: Anthropic reporta input,
cache-create e cache-read em buckets DISJUNTOS, enquanto OpenAI e xAI reportam
cached como SUBCONJUNTO do input. Somar à mão dá double-count silencioso.

O novo omniglyphTelemetry.ts não filtra por denylist — MONTA um objeto novo,
campo a campo, só com número e enum. TransformInfo mistura contadores
inofensivos com material que não pode ser persistido: bytes PNG,
imageSourceText(s), recoverable[].text, os sha8 de system/CLAUDE.md/primeira
mensagem, nomes de tags observadas e o bloco env (cwd, branch, versões). Copiar
o objeto inteiro transformaria telemetria de compressão em vazamento de prompt.
O teste de negação prova que segredo, caminho do operador, texto do system e
base64 não aparecem, e varre a allowlist exigindo que toda string seja de um
enum conhecido.

- provider threaded do chatCore e do bridge Codex WS até a engine; ausente vira
  `unknown`, que faz o upstream recusar adivinhar buckets de cache;
- contabilidade propagada para o engineBreakdown do passo (o agregado do
  pipeline soma todas as engines e não serviria);
- skip não emite contabilidade: zeros ali seriam indistinguíveis de "a engine
  nem rodou".

* feat(compression): perfil do omniglyph configurável, persistido e documentado

Fecha o caminho do operador: o perfil já existia no adapter, mas só como
default de código. Agora atravessa schema Zod, normalizador do banco, API de
settings e a página dedicada do engine.

- OmniglyphConfig tipado + omniglyphConfigSchema (z.enum dos quatro perfis);
- normalizeOmniglyphConfig: nome desconhecido vindo do storage cai para o
  default em vez de virar "roda com a política padrão";
- seletor na página do engine, com PATCH próprio — o perfil vive fora do mapa
  `engines`, e mandá-lo junto reescreveria o mapa inteiro (o store persiste o
  mapa como uma linha JSON só);
- i18n en/pt-BR descrevendo o custo medido de cada perfil, não só o nome;
- README e COMPRESSION_ENGINES.md com a regra do teto e o motivo de o default
  não ser o perfil mais seguro.

Corrige de passagem um teste-irmão que ninguém via: o gate de transporte na UI
deixou de dizer "direct Anthropic" quando os wires OpenAI nativos entraram, mas
tests/unit/ui/omniglyphContextPage.test.tsx continuou afirmando a cópia antiga.
O arquivo inteiro estava excluído do vitest.config.ts como "#8618 pre-existing
failure", então a quebra passou silenciosa. Com a asserção alinhada o arquivo
fecha 3/3, e a exclusão sai — o próprio comentário mandava removê-la quando
corrigida.

A doc não nomeia OMNIGLYPH_MODELS: o gate de docs fabricadas está certo em
apontar que o OmniRoute nunca lê essa env — quem lê é o pacote.

* fix(i18n): paridade do locale vi com as chaves novas do perfil do omniglyph

`tests/unit/i18n-vi-completeness.test.ts` exige paridade ESTRITA de chaves entre
en e vi — diferente do ratchet `i18n:check-ui-coverage`, que passa com 80%. As 11
chaves do seletor de perfil entraram só em en e pt-BR, e o gate de cobertura
seguiu verde, então a quebra só apareceu na matriz completa do CI.

---------

Co-authored-by: Xiangzhe <bakryun0718@proton.me>
Co-authored-by: adevwithpurpose <adevwithpurpose@users.noreply.github.com>
2026-08-18 12:13:48 -03:00

261 lines
9.5 KiB
TypeScript

import {
type CompressionMode,
type CompressionStats,
type CompressionConfig,
DEFAULT_COMPRESSION_CONFIG,
DEFAULT_CAVEMAN_CONFIG,
DEFAULT_RTK_CONFIG,
DEFAULT_COMPRESSION_LANGUAGE_CONFIG,
} from "./types.ts";
import {
countTextTokens,
isCodexTokenizerContext,
tokenizerContextFromBody,
} from "../../../src/shared/utils/tiktokenCounter.ts";
import {
anthropicImageTokens,
ANTHROPIC_IMAGE_BLOCK_OVERHEAD_TOKENS,
openAIVisionTokens,
} from "omniglyph";
const CHARS_PER_TOKEN = 4;
/**
* Anthropic image block shape this estimator recognizes:
* `{ type: "image", source: { type: "base64", media_type: "image/png", data: "<b64>" } }`.
* Only PNG is decoded (the only format omniglyph emits); anything else falls back to
* char-counting that block, same as before.
*/
interface AnthropicImageBlock {
type: "image";
source: { type: "base64"; media_type: string; data: string };
}
interface OpenAIChatImagePart {
type: "image_url";
image_url: { url: string; detail?: string };
}
interface OpenAIResponsesImagePart {
type: "input_image";
image_url: string;
detail?: string;
}
function isAnthropicPngImageBlock(value: unknown): value is AnthropicImageBlock {
if (!value || typeof value !== "object") return false;
const block = value as Record<string, unknown>;
if (block.type !== "image") return false;
const source = block.source as Record<string, unknown> | undefined;
if (!source || typeof source !== "object") return false;
return (
source.type === "base64" && source.media_type === "image/png" && typeof source.data === "string"
);
}
function isOpenAIChatPngImagePart(value: unknown): value is OpenAIChatImagePart {
if (!value || typeof value !== "object") return false;
const part = value as Record<string, unknown>;
const image = part.image_url as Record<string, unknown> | undefined;
return (
part.type === "image_url" &&
!!image &&
typeof image === "object" &&
typeof image.url === "string" &&
image.url.startsWith("data:image/png;base64,")
);
}
function isOpenAIResponsesPngImagePart(value: unknown): value is OpenAIResponsesImagePart {
const part = value as Record<string, unknown> | null;
return (
!!part &&
part.type === "input_image" &&
typeof part.image_url === "string" &&
part.image_url.startsWith("data:image/png;base64,")
);
}
function pngDimensionsFromDataUrl(value: string): { width: number; height: number } | null {
const marker = ";base64,";
const markerIndex = value.indexOf(marker);
if (markerIndex < 0) return null;
return decodePngDimensions(value.slice(markerIndex + marker.length));
}
/**
* Decode PNG width/height from the IHDR chunk without decoding the whole image.
* PNG layout: 8-byte signature, then IHDR chunk `length(4) + "IHDR"(4) + width(4) +
* height(4) + ...`. Width/height live at bytes 16..19 / 20..23 (big-endian uint32),
* so we need through byte 23 (24 raw bytes). We slice the first 64 base64 chars
* → 48 raw bytes, a comfortable margin over the 24 required.
* Returns null (never throws) on malformed/non-PNG/truncated input.
*/
function decodePngDimensions(base64: string): { width: number; height: number } | null {
try {
const prefix = base64.slice(0, 64);
const bytes = Buffer.from(prefix, "base64");
if (bytes.length < 24) return null;
// PNG signature check (bytes 0..7): 89 50 4E 47 0D 0A 1A 0A
const PNG_SIGNATURE = [0x89, 0x50, 0x4e, 0x47, 0x0d, 0x0a, 0x1a, 0x0a];
for (let i = 0; i < PNG_SIGNATURE.length; i++) {
if (bytes[i] !== PNG_SIGNATURE[i]) return null;
}
const width = bytes.readUInt32BE(16);
const height = bytes.readUInt32BE(20);
if (!Number.isFinite(width) || !Number.isFinite(height) || width <= 0 || height <= 0) {
return null;
}
return { width, height };
} catch {
return null;
}
}
/** Char-count fallback for one value (same accounting as the legacy estimator). */
function charTokensOf(value: unknown): number {
if (value === null || value === undefined) return 0;
const str = typeof value === "string" ? value : JSON.stringify(value);
return Math.ceil(str.length / CHARS_PER_TOKEN);
}
/**
* Walk `messages[].content[]` (and `system` when it is an array) looking for Anthropic
* base64 PNG image blocks. For each recognized block: blank its `data` (shallow clone,
* so the char-count pass below doesn't double-count the base64) and add its real
* image-token cost (`anthropicImageTokens` + per-block overhead). Malformed/undecodable
* blocks are left as-is and fall back to char-counting like any other value — never throw.
* Tier is fixed to "standard": production resolves every tier to standard today (measured
* in the omniglyph billing sweep — see anthropic-vision.ts), so there is no model-specific
* signal available here that would change the result.
*/
function blankImageBlocksAndSumImageTokens(body: Record<string, unknown>): {
clone: Record<string, unknown>;
imageTokens: number;
} {
let imageTokens = 0;
const model = typeof body.model === "string" ? body.model : "";
const clone: Record<string, unknown> = { ...body };
const processContentArray = (content: unknown): unknown => {
if (!Array.isArray(content)) return content;
return content.map((block) => {
if (isAnthropicPngImageBlock(block)) {
const dims = decodePngDimensions(block.source.data);
if (!dims) return block; // fall back to char-counting this block as-is
imageTokens += anthropicImageTokens(dims.width, dims.height, "standard");
imageTokens += ANTHROPIC_IMAGE_BLOCK_OVERHEAD_TOKENS;
return { ...block, source: { ...block.source, data: "" } };
}
if (isOpenAIChatPngImagePart(block)) {
const dims = pngDimensionsFromDataUrl(block.image_url.url);
if (!dims) return block;
imageTokens += openAIVisionTokens(model, dims.width, dims.height);
return { ...block, image_url: { ...block.image_url, url: "" } };
}
if (isOpenAIResponsesPngImagePart(block)) {
const dims = pngDimensionsFromDataUrl(block.image_url);
if (!dims) return block;
imageTokens += openAIVisionTokens(model, dims.width, dims.height);
return { ...block, image_url: "" };
}
return block;
});
};
if (Array.isArray(clone.messages)) {
clone.messages = clone.messages.map((message) => {
if (!message || typeof message !== "object") return message;
const m = message as Record<string, unknown>;
if (!Array.isArray(m.content)) return message;
return { ...m, content: processContentArray(m.content) };
});
}
if (Array.isArray(clone.system)) {
clone.system = processContentArray(clone.system);
}
if (Array.isArray(clone.input)) {
clone.input = clone.input.map((item) => {
if (!item || typeof item !== "object") return item;
const record = item as Record<string, unknown>;
return Array.isArray(record.content)
? { ...record, content: processContentArray(record.content) }
: record;
});
}
return { clone, imageTokens };
}
export function estimateCompressionTokens(text: string | object | null | undefined): number {
if (!text) return 0;
if (typeof text === "string") {
return charTokensOf(text);
}
try {
const tokenizerContext = tokenizerContextFromBody(text);
const useExactTokenizer = isCodexTokenizerContext(tokenizerContext);
const { clone, imageTokens } = blankImageBlocksAndSumImageTokens(
text as Record<string, unknown>
);
if (imageTokens === 0) {
// Keep the legacy character estimate for generic payloads. Codex payloads use
// the model-appropriate tokenizer so their compression stats match hard budgets.
return useExactTokenizer
? countTextTokens(JSON.stringify(text), tokenizerContext)
: charTokensOf(text);
}
return useExactTokenizer
? countTextTokens(JSON.stringify(clone), tokenizerContext) + imageTokens
: charTokensOf(clone) + imageTokens;
} catch {
// Non-serializable/unexpected shape → fall back to the legacy char-count,
// never throw out of an estimator.
return charTokensOf(text);
}
}
export function createCompressionStats(
originalBody: Record<string, unknown>,
compressedBody: Record<string, unknown>,
mode: CompressionMode,
techniquesUsed: string[],
rulesApplied?: string[],
durationMs?: number
): CompressionStats {
const originalTokens = estimateCompressionTokens(originalBody);
const compressedTokens = estimateCompressionTokens(compressedBody);
const savingsPercent =
originalTokens > 0
? Math.round(((originalTokens - compressedTokens) / originalTokens) * 10000) / 100
: 0;
return {
originalTokens,
compressedTokens,
savingsPercent,
techniquesUsed,
mode,
timestamp: Date.now(),
...(rulesApplied && rulesApplied.length > 0 ? { rulesApplied } : {}),
...(durationMs !== undefined ? { durationMs } : {}),
};
}
export function trackCompressionStats(stats: CompressionStats): void {
if (stats.originalTokens <= 0) return;
const rulesInfo = stats.rulesApplied?.length ? ` rules=${stats.rulesApplied.join(",")}` : "";
const durationInfo = stats.durationMs !== undefined ? ` ${stats.durationMs}ms` : "";
// Compression stats tracking — no-op in production (use structured logging if needed)
}
export function getDefaultCompressionConfig(): CompressionConfig {
return {
...DEFAULT_COMPRESSION_CONFIG,
cavemanConfig: { ...DEFAULT_CAVEMAN_CONFIG },
rtkConfig: { ...DEFAULT_RTK_CONFIG },
languageConfig: { ...DEFAULT_COMPRESSION_LANGUAGE_CONFIG },
};
}