6×
“Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini.”
Tel que publié sur together.ai. Capturé par usedby le 3 oct. 2026.
Ce qui s’est passé
Decagon runs production inference for its multi-model voice AI agents on Together AI, using hosted open-source and fine-tuned models on NVIDIA B200 GPUs. Together also helped train custom speculative decoding draft models and tune deployments to meet strict latency budgets.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Together AI et de Decagon, pas les nôtres.
- <400ms“Decagon reduced p95 model latency per turn from seconds to <400ms on inputs up to tens of thousands of tokens.”
Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini. This economic improvement made 24/7 voice deployments viable at scale.
Low latency is especially important for voice because there’s a much higher UX bar. Together helped us push latency down by optimizing our models with techniques like speculative decoding, and they’ve been a reliable production partner — proactive about risks and fast when issues come up.
Ce que dit le témoignage, et ce que nous avons vérifié
Nous avons comparé le témoignage à sa page en ligne le 3 oct. 2026.
- Le chiffre : 6×VérifiéImprimé mot pour mot sur la page, près du nom de Decagon.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Decagon.
- Les nombres de notre résuméVérifiéChacun est imprimé sur la page.
- Decagon utilise Together AIVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 3 oct. 2026.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.





