Ir al contenido principal
usedby

95%

“Time to First Token (TTFT): Improved by up to 95%”

Tal como se publicó en together.ai. Verificado por usedby el 9 oct 2026.

Qué pasó

Arcee AI moved the inference for its specialized small language models from AWS-managed Kubernetes (EKS) to Together Dedicated Endpoints, a fully managed GPU deployment. The models power its Arcee Conductor routing and Arcee Orchestra workflow products.

Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Together AI y de Arcee AI, no nuestras.

  • 41+“Throughput (QPS): Achieved 41+ queries per second at 32 concurrent requests, surpassing Arcee AI's requirements.”

Time to First Token (TTFT): Improved by up to 95%, reducing latency of some models from 485ms on AWS to just 29ms on Together Dedicated Endpoints, exceeding expectations.

De la página. together.ai

The migration was a very simple process. We put our models in a private Hugging Face repository, the Together AI team pulled them down and handed us the API, and we just plugged that into our app. That’s what we wanted–a fully managed experience. Everything has been great: full availability, no downtime.

Mark McQuade, CEO, Arcee AI. Fuente

Lo que dice la historia, y lo que verificamos

Lo que comparamos con la página.

  • La cifra: 95%VerificadoImpresa palabra por palabra en la página, cerca del nombre de Arcee AI.
  • El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Arcee AI.
  • Arcee AI usa Together AIVerificadoLínea de nivel Confirmado.
  • El resultado en síNo verificadoLo citamos; no lo medimos.

Misma empresa, misma herramienta o mismo sector.

Arcee AI usa LlamaIndexOtra herramienta en Arcee AI2.5x“train models 2.5x faster than previously experienced on NVIDIA H200s”Mistral AI usa CoreWeave. Mismo sector: Inteligencia Artificial75%“saving 75% in cloud costs”NovelAI usa CoreWeave. Mismo sector: Inteligencia Artificial