95%
“Time to First Token (TTFT): Improved by up to 95%”
Tel que publié sur together.ai. Vérifié par usedby le 9 oct. 2026.
Ce qui s’est passé
Arcee AI moved the inference for its specialized small language models from AWS-managed Kubernetes (EKS) to Together Dedicated Endpoints, a fully managed GPU deployment. The models power its Arcee Conductor routing and Arcee Orchestra workflow products.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Together AI et de Arcee AI, pas les nôtres.
- 41+“Throughput (QPS): Achieved 41+ queries per second at 32 concurrent requests, surpassing Arcee AI's requirements.”
Time to First Token (TTFT): Improved by up to 95%, reducing latency of some models from 485ms on AWS to just 29ms on Together Dedicated Endpoints, exceeding expectations.
The migration was a very simple process. We put our models in a private Hugging Face repository, the Together AI team pulled them down and handed us the API, and we just plugged that into our app. That’s what we wanted–a fully managed experience. Everything has been great: full availability, no downtime.
Ce que dit le témoignage, et ce que nous avons vérifié
Ce que nous avons comparé à la page.
- Le chiffre : 95%VérifiéImprimé mot pour mot sur la page, près du nom de Arcee AI.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Arcee AI.
- Arcee AI utilise Together AIVérifiéLigne de niveau Confirmé.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.





