6×
“Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini.”
Tal como se publicó en together.ai. Capturado por usedby el 3 oct 2026.
Qué pasó
Decagon runs production inference for its multi-model voice AI agents on Together AI, using hosted open-source and fine-tuned models on NVIDIA B200 GPUs. Together also helped train custom speculative decoding draft models and tune deployments to meet strict latency budgets.
Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Together AI y de Decagon, no nuestras.
- <400ms“Decagon reduced p95 model latency per turn from seconds to <400ms on inputs up to tens of thousands of tokens.”
Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini. This economic improvement made 24/7 voice deployments viable at scale.
Low latency is especially important for voice because there’s a much higher UX bar. Together helped us push latency down by optimizing our models with techniques like speculative decoding, and they’ve been a reliable production partner — proactive about risks and fast when issues come up.
Lo que dice la historia, y lo que verificamos
Comparamos la historia con su página en línea el 3 oct 2026.
- La cifra: 6×VerificadoImpresa palabra por palabra en la página, cerca del nombre de Decagon.
- El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Decagon.
- Los números de nuestro resumenVerificadoCada uno está impreso en la página.
- Decagon usa Together AIVerificadoLínea de nivel Confirmado. Última verificación entre todas las fuentes: 3 oct 2026.
- El resultado en síNo verificadoLo citamos; no lo medimos.





