3x
“3x cost savings when moving from closed-source to open-source models”
Tel que publié sur baseten.co, juillet 2026. Capturé par usedby le 5 oct. 2026.
Ce qui s’est passé
Parallel runs the multi-step agentic pipelines behind its web search and research APIs on Baseten. It started on pay-per-token Model APIs, then moved to dedicated deployments of an open-source model and now also trains and deploys fine-tuned models on the platform.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Baseten et de Parallel Web Systems, pas les nôtres.
- 50%“Baseten’s proprietary runtime cut latency by 50% and increased throughput by 3x through KV cache-aware routing and speculative decoding.”
- ~100x“Within a few months of their initial deployment, Parallel scaled traffic with Baseten ~100x.”
Baseten’s throughput and latency optimizations delivered 3x savings versus the equivalent closed-source model. Eliminating redundant processing made it economically viable to run the kind of long, multi-turn agent workflows that deliver meaningfully better results than a single-shot query.
Our workloads can be very spiky. We need to be able to manage the peaks, but we also don't want to pay for the valleys. Pay-per-token with Model APIs enabled us to easily make the transition to open-source until our scale merited dedicated deployments optimized for throughput and flexible autoscaling.
Ce que dit le témoignage, et ce que nous avons vérifié
Nous avons comparé le témoignage à sa page en ligne le 5 oct. 2026.
- Le chiffre : 3xVérifiéImprimé mot pour mot sur la page, près du nom de Parallel Web Systems.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Parallel Web Systems.
- La date de publicationVérifiéLue dans les métadonnées de la page, jamais devinée.
- Parallel Web Systems utilise BasetenVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 5 oct. 2026.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.




