35%
“35% lower cost per million tokens”
Tel que publié sur baseten.co, juillet 2024. Capturé par usedby le 5 oct. 2026.
Ce qui s’est passé
Writer, a generative AI platform for enterprises, uses Baseten to serve its custom 70-billion-parameter Palmyra language models in production. Baseten's performance engineers built optimized TensorRT-LLM engines for secure, private deployments of the healthcare and finance models.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Baseten et de Writer, pas les nôtres.
- 60%“60% higher tokens per second”
- 23%“23% lower time to first token”
With TensorRT-LLM engines deployed on Baseten, Writer surpassed its performance requirements ahead of launching the new models.
Inference for custom-built LLMs could be a major headache. Thanks to Baseten, we’re getting cost-effective high-performance model serving without any extra burden on our internal engineering teams. Instead, we get to focus our expertise on creating the best possible domain-specific LLMs for our customers.
Ce que dit le témoignage, et ce que nous avons vérifié
Nous avons comparé le témoignage à sa page en ligne le 5 oct. 2026.
- Le chiffre : 35%VérifiéImprimé mot pour mot sur la page, près du nom de Writer.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Writer.
- Les nombres de notre résuméVérifiéChacun est imprimé sur la page.
- La date de publicationVérifiéLue dans les métadonnées de la page, jamais devinée.
- Writer utilise BasetenVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 5 oct. 2026.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.




