90%
“Sully reports over 90% reduction in inference costs”
Tel que publié sur baseten.co, février 2026. Vérifié par usedby le 9 oct. 2026.
Ce qui s’est passé
Sully.ai moved the inference behind its healthcare AI agents (clinical notes, decision support, medical coding) from closed-source models to open-source models served on Baseten. The aim was lower cost and latency and more control over model quality.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Baseten et de Sully AI, pas les nôtres.
- 65%“This 65% reduction in median latency resulted in faster, more predictable responses during clinical workflows, improving overall experience for physicians.”
- 29 million“December 2025: Sully has added ~29 million minutes to their customers' workforce overall”
- 2.4+ hours“2.4+ hours time saving per physician”
Sully reports over 90% reduction in inference costs by switching from closed-source platforms to open-source models accessed via Baseten. It enabled them to reinvest these savings in the business to improve agents that help provide more value to practitioners and their patients.
At our scale, inference efficiency matters as much as model quality. Baseten enabled us to cut costs by 90% while delivering significantly faster, more predictable performance. That efficiency is what allows us to add millions of productive minutes back into our customers.
Ce que dit le témoignage, et ce que nous avons vérifié
Ce que nous avons comparé à la page.
- Le chiffre : 90%VérifiéImprimé mot pour mot sur la page, près du nom de Sully AI.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Sully AI.
- La date de publicationVérifiéLue dans les métadonnées de la page, jamais devinée.
- Sully AI utilise BasetenVérifiéLigne de niveau Confirmé.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.




