Aller au contenu principal
usedby

3x

“3x cost savings when moving from closed-source to open-source models”

Tel que publié sur baseten.co, juillet 2026. Capturé par usedby le 5 oct. 2026.

Ce qui s’est passé

Parallel runs the multi-step agentic pipelines behind its web search and research APIs on Baseten. It started on pay-per-token Model APIs, then moved to dedicated deployments of an open-source model and now also trains and deploys fine-tuned models on the platform.

Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Baseten et de Parallel Web Systems, pas les nôtres.

  • 50%“Baseten’s proprietary runtime cut latency by 50% and increased throughput by 3x through KV cache-aware routing and speculative decoding.”
  • ~100x“Within a few months of their initial deployment, Parallel scaled traffic with Baseten ~100x.”

Baseten’s throughput and latency optimizations delivered 3x savings versus the equivalent closed-source model. Eliminating redundant processing made it economically viable to run the kind of long, multi-turn agent workflows that deliver meaningfully better results than a single-shot query.

Extrait de la page. baseten.co, capturée le 5 oct. 2026

Our workloads can be very spiky. We need to be able to manage the peaks, but we also don't want to pay for the valleys. Pay-per-token with Model APIs enabled us to easily make the transition to open-source until our scale merited dedicated deployments optimized for throughput and flexible autoscaling.

Matt Lee, Engineering Lead, Parallel Web Systems. Source, capturée le 5 oct. 2026

Ce que dit le témoignage, et ce que nous avons vérifié

Nous avons comparé le témoignage à sa page en ligne le 5 oct. 2026.

  • Le chiffre : 3xVérifiéImprimé mot pour mot sur la page, près du nom de Parallel Web Systems.
  • L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Parallel Web Systems.
  • La date de publicationVérifiéLue dans les métadonnées de la page, jamais devinée.
  • Parallel Web Systems utilise BasetenVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 5 oct. 2026.
  • Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.

Même entreprise, même outil ou même secteur.

60%“~60% reduction in inference costs”EliseAI utilise Baseten. Un autre client de Baseten10x“Reduced cost by over 10x by shifting to Baseten”Hebbia utilise Baseten. Un autre client de Baseten30%-80%“30%-80% faster image generation per model”Gamma utilise Baseten. Un autre client de Baseten