Aller au contenu principal
usedby

6×

“Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini.”

Tel que publié sur together.ai. Capturé par usedby le 3 oct. 2026.

Ce qui s’est passé

Decagon runs production inference for its multi-model voice AI agents on Together AI, using hosted open-source and fine-tuned models on NVIDIA B200 GPUs. Together also helped train custom speculative decoding draft models and tune deployments to meet strict latency budgets.

Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Together AI et de Decagon, pas les nôtres.

  • <400ms“Decagon reduced p95 model latency per turn from seconds to <400ms on inputs up to tens of thousands of tokens.”

Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini. This economic improvement made 24/7 voice deployments viable at scale.

Extrait de la page. together.ai, capturée le 3 oct. 2026

Low latency is especially important for voice because there’s a much higher UX bar. Together helped us push latency down by optimizing our models with techniques like speculative decoding, and they’ve been a reliable production partner — proactive about risks and fast when issues come up.

Max Lu, Head of Research, Decagon. Source, capturée le 3 oct. 2026

Ce que dit le témoignage, et ce que nous avons vérifié

Nous avons comparé le témoignage à sa page en ligne le 3 oct. 2026.

  • Le chiffre : 6×VérifiéImprimé mot pour mot sur la page, près du nom de Decagon.
  • L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Decagon.
  • Les nombres de notre résuméVérifiéChacun est imprimé sur la page.
  • Decagon utilise Together AIVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 3 oct. 2026.
  • Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.

Même entreprise, même outil ou même secteur.

under two weeks“Together’s team shipped FP8, FP4, and INT4 quantized variants of the Cogito models in under two weeks”Deep Cogito utilise Together AI. Un autre client de Together AICursor utilise Together AIUn autre client de Together AI2.5x“train models 2.5x faster than previously experienced on NVIDIA H200s”Mistral AI utilise CoreWeave. Même secteur : Intelligence Artificielle