Aller au contenu principal
usedby

Tel que publié sur braintrust.dev. Capturé par usedby le 6 oct. 2026.

Ce qui s’est passé

Cloudflare's Agent Experience team uses Braintrust to evaluate its dashboard agent, running an LLM-as-a-judge over whole conversations to score resolution, gating skill, prompt and recipe changes in CI/CD, and benchmarking sub-agents against models of varying capacity.

Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Braintrust et de Cloudflare, pas les nôtres.

The dashboard agent's behavior lives in skills, recipes, and prompts, and every change runs through evals in CI/CD. Cloudflare built a shared component, now used across platform internals, that measures skill performance before and after a change.

Extrait de la page. braintrust.dev, capturée le 6 oct. 2026

Instead of shipping changes, measuring them in production, and going back to the drawing board, we get to iterate directly in development, see how it performs, and then ship it to production.

Kylie Czajkowski, Agent Experience Manager, Cloudflare. Source, capturée le 6 oct. 2026

Ce que dit le témoignage, et ce que nous avons vérifié

Nous avons comparé le témoignage à sa page en ligne le 6 oct. 2026.

  • L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Cloudflare.
  • Cloudflare utilise BraintrustVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 6 oct. 2026.
  • Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.

Même entreprise, même outil ou même secteur.

80%+Score threshold for internal releaseBox utilise Braintrust. Un autre client de Braintrust>0.9Eval system macro F1 scoreNavan utilise Braintrust. Un autre client de Braintrust75 percent“75 percent reduction in incident investigation time”Zscaler utilise Resolve. Même secteur : Cybersécurité