3x
“3x cost savings when moving from closed-source to open-source models”
Tal como se publicó en baseten.co, julio de 2026. Capturado por usedby el 5 oct 2026.
Qué pasó
Parallel runs the multi-step agentic pipelines behind its web search and research APIs on Baseten. It started on pay-per-token Model APIs, then moved to dedicated deployments of an open-source model and now also trains and deploys fine-tuned models on the platform.
Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Baseten y de Parallel Web Systems, no nuestras.
- 50%“Baseten’s proprietary runtime cut latency by 50% and increased throughput by 3x through KV cache-aware routing and speculative decoding.”
- ~100x“Within a few months of their initial deployment, Parallel scaled traffic with Baseten ~100x.”
Baseten’s throughput and latency optimizations delivered 3x savings versus the equivalent closed-source model. Eliminating redundant processing made it economically viable to run the kind of long, multi-turn agent workflows that deliver meaningfully better results than a single-shot query.
Our workloads can be very spiky. We need to be able to manage the peaks, but we also don't want to pay for the valleys. Pay-per-token with Model APIs enabled us to easily make the transition to open-source until our scale merited dedicated deployments optimized for throughput and flexible autoscaling.
Lo que dice la historia, y lo que verificamos
Comparamos la historia con su página en línea el 5 oct 2026.
- La cifra: 3xVerificadoImpresa palabra por palabra en la página, cerca del nombre de Parallel Web Systems.
- El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Parallel Web Systems.
- La fecha de publicaciónVerificadoLeída en los metadatos de la propia página, nunca adivinada.
- Parallel Web Systems usa BasetenVerificadoLínea de nivel Confirmado. Última verificación entre todas las fuentes: 5 oct 2026.
- El resultado en síNo verificadoLo citamos; no lo medimos.




