10x
“Reduced cost by over 10x by shifting to Baseten”
Tal como se publicó en baseten.co, abril de 2026. Capturado por usedby el 5 oct 2026.
Qué pasó
Hebbia runs a dedicated deployment of an open-source LLM on Baseten to serve latency-sensitive chat traffic for its institutional finance customers. It moved from a closed-source model provider and uses Baseten's elastic infrastructure to pay only for the GPUs it uses.
Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Baseten y de Hebbia, no nuestras.
- 2.5x“2.5x improvement in TPS and 4x improvement in TTFT using the Baseten Inference Stack”
By shifting from a closed-source model provider to Baseten, Hebbia reduced inference costs by over 10x without compromising on the reliability or latency their enterprise customers depend on.
Our customers really care about speed, reliability, and the ability to deploy custom fine-tuned models for financial services. Baseten met all three criteria so far and it’s been a boon to our business.
Lo que dice la historia, y lo que verificamos
Comparamos la historia con su página en línea el 5 oct 2026.
- La cifra: 10xVerificadoImpresa palabra por palabra en la página, cerca del nombre de Hebbia.
- El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Hebbia.
- La fecha de publicaciónVerificadoLeída en los metadatos de la propia página, nunca adivinada.
- Hebbia usa BasetenVerificadoLínea de nivel Confirmado. Última verificación entre todas las fuentes: 5 oct 2026.
- El resultado en síNo verificadoLo citamos; no lo medimos.




