Aller au contenu principal
usedby

80%+

Score threshold for internal release

Tel que publié sur braintrust.dev. Capturé par usedby le 6 oct. 2026.

Ce qui s’est passé

Box's product managers use Braintrust as the system of record for the datasets, experiments and metrics behind evals of the Box Agent. They run programmatic evals nightly, cluster failures with tags, grade outputs with LLM and code-based graders, and compare models against a fixed baseline dataset.

Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Braintrust et de Box, pas les nôtres.

Box's path to launch was determined by datasets. Before opening the agent to internal dogfooding, the team built a set of roughly eighty questions covering core functionality and decided there would be no internal release until the agent scored above 80%.

Extrait de la page. braintrust.dev, capturée le 6 oct. 2026

Ce que dit le témoignage, et ce que nous avons vérifié

Nous avons comparé le témoignage à sa page en ligne le 6 oct. 2026.

  • Le chiffre : 80%+VérifiéLe chiffre est sur la page ; son libellé est formulé par nous.
  • L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Box.
  • Box utilise BraintrustVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 6 oct. 2026.
  • Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.

Même entreprise, même outil ou même secteur.

>0.9Eval system macro F1 scoreNavan utilise Braintrust. Un autre client de Braintrust~10 → 0 minsEngineering time to debug an issuePylon utilise Braintrust. Un autre client de Braintrust30-min“Continuous signal, 30-min fix cycles”Rex utilise Braintrust. Un autre client de Braintrust