Ir al contenido principal
usedby

6×

“Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini.”

Tal como se publicó en together.ai. Capturado por usedby el 3 oct 2026.

Qué pasó

Decagon runs production inference for its multi-model voice AI agents on Together AI, using hosted open-source and fine-tuned models on NVIDIA B200 GPUs. Together also helped train custom speculative decoding draft models and tune deployments to meet strict latency budgets.

Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Together AI y de Decagon, no nuestras.

  • <400ms“Decagon reduced p95 model latency per turn from seconds to <400ms on inputs up to tens of thousands of tokens.”

Decagon achieved nearly 6× cost reduction per turn compared to closed models like GPT-5 mini. This economic improvement made 24/7 voice deployments viable at scale.

De la página. together.ai, capturada el 3 oct 2026

Low latency is especially important for voice because there’s a much higher UX bar. Together helped us push latency down by optimizing our models with techniques like speculative decoding, and they’ve been a reliable production partner — proactive about risks and fast when issues come up.

Max Lu, Head of Research, Decagon. Fuente, capturada el 3 oct 2026

Lo que dice la historia, y lo que verificamos

Comparamos la historia con su página en línea el 3 oct 2026.

  • La cifra: 6×VerificadoImpresa palabra por palabra en la página, cerca del nombre de Decagon.
  • El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Decagon.
  • Los números de nuestro resumenVerificadoCada uno está impreso en la página.
  • Decagon usa Together AIVerificadoLínea de nivel Confirmado. Última verificación entre todas las fuentes: 3 oct 2026.
  • El resultado en síNo verificadoLo citamos; no lo medimos.

Misma empresa, misma herramienta o mismo sector.

under two weeks“Together’s team shipped FP8, FP4, and INT4 quantized variants of the Cogito models in under two weeks”Deep Cogito usa Together AI. Otro cliente de Together AICursor usa Together AIOtro cliente de Together AI2.5x“train models 2.5x faster than previously experienced on NVIDIA H200s”Mistral AI usa CoreWeave. Mismo sector: Inteligencia Artificial