10x
“Reduced cost by over 10x by shifting to Baseten”
Tel que publié sur baseten.co, avril 2026. Capturé par usedby le 5 oct. 2026.
Ce qui s’est passé
Hebbia runs a dedicated deployment of an open-source LLM on Baseten to serve latency-sensitive chat traffic for its institutional finance customers. It moved from a closed-source model provider and uses Baseten's elastic infrastructure to pay only for the GPUs it uses.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Baseten et de Hebbia, pas les nôtres.
- 2.5x“2.5x improvement in TPS and 4x improvement in TTFT using the Baseten Inference Stack”
By shifting from a closed-source model provider to Baseten, Hebbia reduced inference costs by over 10x without compromising on the reliability or latency their enterprise customers depend on.
Our customers really care about speed, reliability, and the ability to deploy custom fine-tuned models for financial services. Baseten met all three criteria so far and it’s been a boon to our business.
Ce que dit le témoignage, et ce que nous avons vérifié
Nous avons comparé le témoignage à sa page en ligne le 5 oct. 2026.
- Le chiffre : 10xVérifiéImprimé mot pour mot sur la page, près du nom de Hebbia.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Hebbia.
- La date de publicationVérifiéLue dans les métadonnées de la page, jamais devinée.
- Hebbia utilise BasetenVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 5 oct. 2026.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.




