mirror of
https://github.com/diegosouzapw/OmniRoute.git
synced 2026-08-20 06:02:14 +03:00
* feat(compression): target-wire OmniGlyph stage and transport fidelity gate Roda o OmniGlyph depois da tradução para o wire real do provedor, em vez do corpo de origem. Um cliente OpenAI roteado para Claude deixava de comprimir com skip:source_format_not_claude porque o corpo ainda estava em formato OpenAI quando a engine era avaliada. - dispatch nativo por wire: Anthropic Messages, OpenAI Chat Completions e OpenAI Responses (input[] preservado, sem achatar para messages[]); - estágio target-wire pós-translateRequest, com guarda contra dupla compressão no caminho Claude→OpenAI; - preserveSystemPrompt do OmniRoute mapeado para compressSystem: false; - imageTransportPolicy: fidelidade de bytes/dimensões separada de supportsVision; só Anthropic/Claude tem recibo byte-preserving, o resto é fail-closed; - contagem de tokens de data URL PNG no wire OpenAI (marcador ;base64,); - README e i18n en/pt-BR com claims escopados ao caminho medido. * feat(compression): adota omniglyph 1.4.0 e tira o gate de modelo da env do host O 1.4.0 introduziu escopos de segurança e passou a resolvê-los dentro de isOmniGlyphSupportedModel() lendo process.env.OMNIGLYPH_PROFILE. Somado ao OMNIGLYPH_MODELS que já existia, duas variáveis do ambiente do host decidiam em silêncio o gate de TODO request do OmniRoute: passthrough desligaria a engine inteira e OMNIGLYPH_MODELS admitiria modelos sem recibo medido, enquanto a UI segue prometendo "Claude Fable 5 na rota direta medida". O adapter passa a usar isOmniGlyphSupportedModelForScope() com escopo explícito e fixa o escopo mais restrito como teto: a env só pode ESTREITAR a allowlist, nunca alargar. Os dois wires compartilham a mesma lista no pacote desde o 1.4.0, então uma checagem cobre Anthropic e GPT. - omniglyph ^1.3.1 -> ^1.4.0 (lock em 1.4.0); - testes de regressão para os dois caminhos de sequestro por env; - teste de contrato dos exports novos (escopo, perfis, accounting). O 1.4.0 também traz, sem mudança de código aqui: correção do glyph K que era lido como H, remoção do backtracking polinomial no secret-guard, overrides do pnpm em pnpm-workspace.yaml e as transitivas vulneráveis resolvidas. * feat(compression): expõe os perfis semânticos do omniglyph nos três wires O 1.4.0 trouxe perfis nomeados (coding-safe, balanced, aggressive, passthrough), mas só transformAnthropicMessages() os resolve sozinho: os transformadores OpenAI recebem TransformOptions cru e ignorariam o campo. Um perfil escolhido pelo operador valeria no wire Claude e sumiria no OpenAI. O adapter passa a mesclar o perfil com mergeCompressionProfileOptions() antes de chamar Chat Completions e Responses. O default segue aggressive — a política que os recibos publicados mediram. Medido nesta base: com coding-safe/balanced, uma sessão sem histórico acumulado para em below_min_chars e a engine não faz nada, porque os dois fixam minCompressChars no máximo e desligam system/tools/tool-results. Como a engine é opt-in, um default assim entregaria "ligado, 0% de ganho". O perfil é TETO, não piso: mergeCompressionProfileOptions não deixa um override do chamador reabrir uma lane lossy que o perfil fechou. Coberto por teste, por ser contra-intuitivo. Também fecha um caminho em que o OmniRoute violaria a própria política: o wire OpenAI do pacote não tem compressSystem — honra apenas compressTools, gptHistory, minCompressChars e reflow, e sempre troca a instrução por um ponteiro para a imagem. Com preserveSystemPrompt ligado, imagear assim queimaria o prefixo quente que a decisão cache-aware está protegendo, sem nada no corpo devolvido denunciando. A engine agora pula com skip:system_preservation_unsupported_on_wire. * feat(compression): contabilidade física do omniglyph com grau de evidência O adapter descartava o TransformInfo inteiro, então a UI mostrava um número de economia sem dizer de onde ele vinha — contagem do provider, estimativa ou só diferença de bytes. O 1.4.0 expõe normalizeAccounting(), que classifica essa evidência e resolve a semântica de cache por família: Anthropic reporta input, cache-create e cache-read em buckets DISJUNTOS, enquanto OpenAI e xAI reportam cached como SUBCONJUNTO do input. Somar à mão dá double-count silencioso. O novo omniglyphTelemetry.ts não filtra por denylist — MONTA um objeto novo, campo a campo, só com número e enum. TransformInfo mistura contadores inofensivos com material que não pode ser persistido: bytes PNG, imageSourceText(s), recoverable[].text, os sha8 de system/CLAUDE.md/primeira mensagem, nomes de tags observadas e o bloco env (cwd, branch, versões). Copiar o objeto inteiro transformaria telemetria de compressão em vazamento de prompt. O teste de negação prova que segredo, caminho do operador, texto do system e base64 não aparecem, e varre a allowlist exigindo que toda string seja de um enum conhecido. - provider threaded do chatCore e do bridge Codex WS até a engine; ausente vira `unknown`, que faz o upstream recusar adivinhar buckets de cache; - contabilidade propagada para o engineBreakdown do passo (o agregado do pipeline soma todas as engines e não serviria); - skip não emite contabilidade: zeros ali seriam indistinguíveis de "a engine nem rodou". * feat(compression): perfil do omniglyph configurável, persistido e documentado Fecha o caminho do operador: o perfil já existia no adapter, mas só como default de código. Agora atravessa schema Zod, normalizador do banco, API de settings e a página dedicada do engine. - OmniglyphConfig tipado + omniglyphConfigSchema (z.enum dos quatro perfis); - normalizeOmniglyphConfig: nome desconhecido vindo do storage cai para o default em vez de virar "roda com a política padrão"; - seletor na página do engine, com PATCH próprio — o perfil vive fora do mapa `engines`, e mandá-lo junto reescreveria o mapa inteiro (o store persiste o mapa como uma linha JSON só); - i18n en/pt-BR descrevendo o custo medido de cada perfil, não só o nome; - README e COMPRESSION_ENGINES.md com a regra do teto e o motivo de o default não ser o perfil mais seguro. Corrige de passagem um teste-irmão que ninguém via: o gate de transporte na UI deixou de dizer "direct Anthropic" quando os wires OpenAI nativos entraram, mas tests/unit/ui/omniglyphContextPage.test.tsx continuou afirmando a cópia antiga. O arquivo inteiro estava excluído do vitest.config.ts como "#8618 pre-existing failure", então a quebra passou silenciosa. Com a asserção alinhada o arquivo fecha 3/3, e a exclusão sai — o próprio comentário mandava removê-la quando corrigida. A doc não nomeia OMNIGLYPH_MODELS: o gate de docs fabricadas está certo em apontar que o OmniRoute nunca lê essa env — quem lê é o pacote. * fix(i18n): paridade do locale vi com as chaves novas do perfil do omniglyph `tests/unit/i18n-vi-completeness.test.ts` exige paridade ESTRITA de chaves entre en e vi — diferente do ratchet `i18n:check-ui-coverage`, que passa com 80%. As 11 chaves do seletor de perfil entraram só em en e pt-BR, e o gate de cobertura seguiu verde, então a quebra só apareceu na matriz completa do CI. --------- Co-authored-by: Xiangzhe <bakryun0718@proton.me> Co-authored-by: adevwithpurpose <adevwithpurpose@users.noreply.github.com>
261 lines
9.5 KiB
TypeScript
261 lines
9.5 KiB
TypeScript
import {
|
|
type CompressionMode,
|
|
type CompressionStats,
|
|
type CompressionConfig,
|
|
DEFAULT_COMPRESSION_CONFIG,
|
|
DEFAULT_CAVEMAN_CONFIG,
|
|
DEFAULT_RTK_CONFIG,
|
|
DEFAULT_COMPRESSION_LANGUAGE_CONFIG,
|
|
} from "./types.ts";
|
|
import {
|
|
countTextTokens,
|
|
isCodexTokenizerContext,
|
|
tokenizerContextFromBody,
|
|
} from "../../../src/shared/utils/tiktokenCounter.ts";
|
|
import {
|
|
anthropicImageTokens,
|
|
ANTHROPIC_IMAGE_BLOCK_OVERHEAD_TOKENS,
|
|
openAIVisionTokens,
|
|
} from "omniglyph";
|
|
|
|
const CHARS_PER_TOKEN = 4;
|
|
|
|
/**
|
|
* Anthropic image block shape this estimator recognizes:
|
|
* `{ type: "image", source: { type: "base64", media_type: "image/png", data: "<b64>" } }`.
|
|
* Only PNG is decoded (the only format omniglyph emits); anything else falls back to
|
|
* char-counting that block, same as before.
|
|
*/
|
|
interface AnthropicImageBlock {
|
|
type: "image";
|
|
source: { type: "base64"; media_type: string; data: string };
|
|
}
|
|
|
|
interface OpenAIChatImagePart {
|
|
type: "image_url";
|
|
image_url: { url: string; detail?: string };
|
|
}
|
|
|
|
interface OpenAIResponsesImagePart {
|
|
type: "input_image";
|
|
image_url: string;
|
|
detail?: string;
|
|
}
|
|
|
|
function isAnthropicPngImageBlock(value: unknown): value is AnthropicImageBlock {
|
|
if (!value || typeof value !== "object") return false;
|
|
const block = value as Record<string, unknown>;
|
|
if (block.type !== "image") return false;
|
|
const source = block.source as Record<string, unknown> | undefined;
|
|
if (!source || typeof source !== "object") return false;
|
|
return (
|
|
source.type === "base64" && source.media_type === "image/png" && typeof source.data === "string"
|
|
);
|
|
}
|
|
|
|
function isOpenAIChatPngImagePart(value: unknown): value is OpenAIChatImagePart {
|
|
if (!value || typeof value !== "object") return false;
|
|
const part = value as Record<string, unknown>;
|
|
const image = part.image_url as Record<string, unknown> | undefined;
|
|
return (
|
|
part.type === "image_url" &&
|
|
!!image &&
|
|
typeof image === "object" &&
|
|
typeof image.url === "string" &&
|
|
image.url.startsWith("data:image/png;base64,")
|
|
);
|
|
}
|
|
|
|
function isOpenAIResponsesPngImagePart(value: unknown): value is OpenAIResponsesImagePart {
|
|
const part = value as Record<string, unknown> | null;
|
|
return (
|
|
!!part &&
|
|
part.type === "input_image" &&
|
|
typeof part.image_url === "string" &&
|
|
part.image_url.startsWith("data:image/png;base64,")
|
|
);
|
|
}
|
|
|
|
function pngDimensionsFromDataUrl(value: string): { width: number; height: number } | null {
|
|
const marker = ";base64,";
|
|
const markerIndex = value.indexOf(marker);
|
|
if (markerIndex < 0) return null;
|
|
return decodePngDimensions(value.slice(markerIndex + marker.length));
|
|
}
|
|
|
|
/**
|
|
* Decode PNG width/height from the IHDR chunk without decoding the whole image.
|
|
* PNG layout: 8-byte signature, then IHDR chunk `length(4) + "IHDR"(4) + width(4) +
|
|
* height(4) + ...`. Width/height live at bytes 16..19 / 20..23 (big-endian uint32),
|
|
* so we need through byte 23 (24 raw bytes). We slice the first 64 base64 chars
|
|
* → 48 raw bytes, a comfortable margin over the 24 required.
|
|
* Returns null (never throws) on malformed/non-PNG/truncated input.
|
|
*/
|
|
function decodePngDimensions(base64: string): { width: number; height: number } | null {
|
|
try {
|
|
const prefix = base64.slice(0, 64);
|
|
const bytes = Buffer.from(prefix, "base64");
|
|
if (bytes.length < 24) return null;
|
|
// PNG signature check (bytes 0..7): 89 50 4E 47 0D 0A 1A 0A
|
|
const PNG_SIGNATURE = [0x89, 0x50, 0x4e, 0x47, 0x0d, 0x0a, 0x1a, 0x0a];
|
|
for (let i = 0; i < PNG_SIGNATURE.length; i++) {
|
|
if (bytes[i] !== PNG_SIGNATURE[i]) return null;
|
|
}
|
|
const width = bytes.readUInt32BE(16);
|
|
const height = bytes.readUInt32BE(20);
|
|
if (!Number.isFinite(width) || !Number.isFinite(height) || width <= 0 || height <= 0) {
|
|
return null;
|
|
}
|
|
return { width, height };
|
|
} catch {
|
|
return null;
|
|
}
|
|
}
|
|
|
|
/** Char-count fallback for one value (same accounting as the legacy estimator). */
|
|
function charTokensOf(value: unknown): number {
|
|
if (value === null || value === undefined) return 0;
|
|
const str = typeof value === "string" ? value : JSON.stringify(value);
|
|
return Math.ceil(str.length / CHARS_PER_TOKEN);
|
|
}
|
|
|
|
/**
|
|
* Walk `messages[].content[]` (and `system` when it is an array) looking for Anthropic
|
|
* base64 PNG image blocks. For each recognized block: blank its `data` (shallow clone,
|
|
* so the char-count pass below doesn't double-count the base64) and add its real
|
|
* image-token cost (`anthropicImageTokens` + per-block overhead). Malformed/undecodable
|
|
* blocks are left as-is and fall back to char-counting like any other value — never throw.
|
|
* Tier is fixed to "standard": production resolves every tier to standard today (measured
|
|
* in the omniglyph billing sweep — see anthropic-vision.ts), so there is no model-specific
|
|
* signal available here that would change the result.
|
|
*/
|
|
function blankImageBlocksAndSumImageTokens(body: Record<string, unknown>): {
|
|
clone: Record<string, unknown>;
|
|
imageTokens: number;
|
|
} {
|
|
let imageTokens = 0;
|
|
const model = typeof body.model === "string" ? body.model : "";
|
|
const clone: Record<string, unknown> = { ...body };
|
|
|
|
const processContentArray = (content: unknown): unknown => {
|
|
if (!Array.isArray(content)) return content;
|
|
return content.map((block) => {
|
|
if (isAnthropicPngImageBlock(block)) {
|
|
const dims = decodePngDimensions(block.source.data);
|
|
if (!dims) return block; // fall back to char-counting this block as-is
|
|
imageTokens += anthropicImageTokens(dims.width, dims.height, "standard");
|
|
imageTokens += ANTHROPIC_IMAGE_BLOCK_OVERHEAD_TOKENS;
|
|
return { ...block, source: { ...block.source, data: "" } };
|
|
}
|
|
if (isOpenAIChatPngImagePart(block)) {
|
|
const dims = pngDimensionsFromDataUrl(block.image_url.url);
|
|
if (!dims) return block;
|
|
imageTokens += openAIVisionTokens(model, dims.width, dims.height);
|
|
return { ...block, image_url: { ...block.image_url, url: "" } };
|
|
}
|
|
if (isOpenAIResponsesPngImagePart(block)) {
|
|
const dims = pngDimensionsFromDataUrl(block.image_url);
|
|
if (!dims) return block;
|
|
imageTokens += openAIVisionTokens(model, dims.width, dims.height);
|
|
return { ...block, image_url: "" };
|
|
}
|
|
return block;
|
|
});
|
|
};
|
|
|
|
if (Array.isArray(clone.messages)) {
|
|
clone.messages = clone.messages.map((message) => {
|
|
if (!message || typeof message !== "object") return message;
|
|
const m = message as Record<string, unknown>;
|
|
if (!Array.isArray(m.content)) return message;
|
|
return { ...m, content: processContentArray(m.content) };
|
|
});
|
|
}
|
|
|
|
if (Array.isArray(clone.system)) {
|
|
clone.system = processContentArray(clone.system);
|
|
}
|
|
|
|
if (Array.isArray(clone.input)) {
|
|
clone.input = clone.input.map((item) => {
|
|
if (!item || typeof item !== "object") return item;
|
|
const record = item as Record<string, unknown>;
|
|
return Array.isArray(record.content)
|
|
? { ...record, content: processContentArray(record.content) }
|
|
: record;
|
|
});
|
|
}
|
|
|
|
return { clone, imageTokens };
|
|
}
|
|
|
|
export function estimateCompressionTokens(text: string | object | null | undefined): number {
|
|
if (!text) return 0;
|
|
if (typeof text === "string") {
|
|
return charTokensOf(text);
|
|
}
|
|
try {
|
|
const tokenizerContext = tokenizerContextFromBody(text);
|
|
const useExactTokenizer = isCodexTokenizerContext(tokenizerContext);
|
|
const { clone, imageTokens } = blankImageBlocksAndSumImageTokens(
|
|
text as Record<string, unknown>
|
|
);
|
|
if (imageTokens === 0) {
|
|
// Keep the legacy character estimate for generic payloads. Codex payloads use
|
|
// the model-appropriate tokenizer so their compression stats match hard budgets.
|
|
return useExactTokenizer
|
|
? countTextTokens(JSON.stringify(text), tokenizerContext)
|
|
: charTokensOf(text);
|
|
}
|
|
return useExactTokenizer
|
|
? countTextTokens(JSON.stringify(clone), tokenizerContext) + imageTokens
|
|
: charTokensOf(clone) + imageTokens;
|
|
} catch {
|
|
// Non-serializable/unexpected shape → fall back to the legacy char-count,
|
|
// never throw out of an estimator.
|
|
return charTokensOf(text);
|
|
}
|
|
}
|
|
|
|
export function createCompressionStats(
|
|
originalBody: Record<string, unknown>,
|
|
compressedBody: Record<string, unknown>,
|
|
mode: CompressionMode,
|
|
techniquesUsed: string[],
|
|
rulesApplied?: string[],
|
|
durationMs?: number
|
|
): CompressionStats {
|
|
const originalTokens = estimateCompressionTokens(originalBody);
|
|
const compressedTokens = estimateCompressionTokens(compressedBody);
|
|
const savingsPercent =
|
|
originalTokens > 0
|
|
? Math.round(((originalTokens - compressedTokens) / originalTokens) * 10000) / 100
|
|
: 0;
|
|
return {
|
|
originalTokens,
|
|
compressedTokens,
|
|
savingsPercent,
|
|
techniquesUsed,
|
|
mode,
|
|
timestamp: Date.now(),
|
|
...(rulesApplied && rulesApplied.length > 0 ? { rulesApplied } : {}),
|
|
...(durationMs !== undefined ? { durationMs } : {}),
|
|
};
|
|
}
|
|
|
|
export function trackCompressionStats(stats: CompressionStats): void {
|
|
if (stats.originalTokens <= 0) return;
|
|
const rulesInfo = stats.rulesApplied?.length ? ` rules=${stats.rulesApplied.join(",")}` : "";
|
|
const durationInfo = stats.durationMs !== undefined ? ` ${stats.durationMs}ms` : "";
|
|
// Compression stats tracking — no-op in production (use structured logging if needed)
|
|
}
|
|
|
|
export function getDefaultCompressionConfig(): CompressionConfig {
|
|
return {
|
|
...DEFAULT_COMPRESSION_CONFIG,
|
|
cavemanConfig: { ...DEFAULT_CAVEMAN_CONFIG },
|
|
rtkConfig: { ...DEFAULT_RTK_CONFIG },
|
|
languageConfig: { ...DEFAULT_COMPRESSION_LANGUAGE_CONFIG },
|
|
};
|
|
}
|