35%
“35% lower cost per million tokens”
Tal como se publicó en baseten.co, julio de 2024. Capturado por usedby el 5 oct 2026.
Qué pasó
Writer, a generative AI platform for enterprises, uses Baseten to serve its custom 70-billion-parameter Palmyra language models in production. Baseten's performance engineers built optimized TensorRT-LLM engines for secure, private deployments of the healthcare and finance models.
Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Baseten y de Writer, no nuestras.
- 60%“60% higher tokens per second”
- 23%“23% lower time to first token”
With TensorRT-LLM engines deployed on Baseten, Writer surpassed its performance requirements ahead of launching the new models.
Inference for custom-built LLMs could be a major headache. Thanks to Baseten, we’re getting cost-effective high-performance model serving without any extra burden on our internal engineering teams. Instead, we get to focus our expertise on creating the best possible domain-specific LLMs for our customers.
Lo que dice la historia, y lo que verificamos
Comparamos la historia con su página en línea el 5 oct 2026.
- La cifra: 35%VerificadoImpresa palabra por palabra en la página, cerca del nombre de Writer.
- El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Writer.
- Los números de nuestro resumenVerificadoCada uno está impreso en la página.
- La fecha de publicaciónVerificadoLeída en los metadatos de la propia página, nunca adivinada.
- Writer usa BasetenVerificadoLínea de nivel Confirmado. Última verificación entre todas las fuentes: 5 oct 2026.
- El resultado en síNo verificadoLo citamos; no lo medimos.




