Aller au contenu principal
usedby

95%

“Time to First Token (TTFT): Improved by up to 95%”

Tel que publié sur together.ai. Vérifié par usedby le 9 oct. 2026.

Ce qui s’est passé

Arcee AI moved the inference for its specialized small language models from AWS-managed Kubernetes (EKS) to Together Dedicated Endpoints, a fully managed GPU deployment. The models power its Arcee Conductor routing and Arcee Orchestra workflow products.

Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Together AI et de Arcee AI, pas les nôtres.

  • 41+“Throughput (QPS): Achieved 41+ queries per second at 32 concurrent requests, surpassing Arcee AI's requirements.”

Time to First Token (TTFT): Improved by up to 95%, reducing latency of some models from 485ms on AWS to just 29ms on Together Dedicated Endpoints, exceeding expectations.

Extrait de la page. together.ai

The migration was a very simple process. We put our models in a private Hugging Face repository, the Together AI team pulled them down and handed us the API, and we just plugged that into our app. That’s what we wanted–a fully managed experience. Everything has been great: full availability, no downtime.

Mark McQuade, CEO, Arcee AI. Source

Ce que dit le témoignage, et ce que nous avons vérifié

Ce que nous avons comparé à la page.

  • Le chiffre : 95%VérifiéImprimé mot pour mot sur la page, près du nom de Arcee AI.
  • L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Arcee AI.
  • Arcee AI utilise Together AIVérifiéLigne de niveau Confirmé.
  • Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.

Même entreprise, même outil ou même secteur.

Arcee AI utilise LlamaIndexUn autre outil chez Arcee AI2.5x“train models 2.5x faster than previously experienced on NVIDIA H200s”Mistral AI utilise CoreWeave. Même secteur : Intelligence Artificielle75%“saving 75% in cloud costs”NovelAI utilise CoreWeave. Même secteur : Intelligence Artificielle