Cloudflare libera pesos abertos dos modelos de decisão Clef e Clef‑flash
Pesos foram publicados sob Apache 2.0; Clef tem 27B e janela de 64k tokens, Clef‑flash é versão de 9B otimizada para baixa latência
A Cloudflare anunciou em 1º de outubro de 2026 dois modelos de decisão e publicou seus pesos no Hugging Face sob a licença Apache 2.0: Clef (27 bilhões de parâmetros) e Clef‑flash (9 bilhões).
Clef é um modelo maior com janela de contexto de 64.000 tokens e suporte a entrada visual. Clef‑flash é uma versão otimizada para latência, voltada para decisões na chamada “hot path”.
A empresa relatou ganhos de acurácia em benchmarks como BANKING77 e latências médias muito menores para Clef‑flash em comparação com o Jev da TypeSafe, mas esses números vêm de fornecedores, são contestados e dependem do tipo de workload.
Um teste independente com 42 casos executando Clef‑flash em uma RTX 3090 reproduziu a maior parte das chamadas do Jev, mas ficou atrás em casos de triagem mais sutis (Jev 71,4% vs Clef‑flash 66,7%) e mostrou latência p50 local mais alta. O Clef completo de 27B exige cerca de 54 GB de VRAM bf16.
Praticantes devem adotar os modelos de forma seletiva: rodar shadowing (execução paralela para comparação), registrar as distribuições de probabilidade completas, manter intervenção humana para decisões de alto risco e combinar execuções locais ou na borda com chamadas hospedadas pagas para equilibrar custo, privacidade e precisão.