80%+
Score threshold for internal release
Tel que publié sur braintrust.dev. Capturé par usedby le 6 oct. 2026.
Ce qui s’est passé
Box's product managers use Braintrust as the system of record for the datasets, experiments and metrics behind evals of the Box Agent. They run programmatic evals nightly, cluster failures with tags, grade outputs with LLM and code-based graders, and compare models against a fixed baseline dataset.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Braintrust et de Box, pas les nôtres.
Box's path to launch was determined by datasets. Before opening the agent to internal dogfooding, the team built a set of roughly eighty questions covering core functionality and decided there would be no internal release until the agent scored above 80%.
Ce que dit le témoignage, et ce que nous avons vérifié
Nous avons comparé le témoignage à sa page en ligne le 6 oct. 2026.
- Le chiffre : 80%+VérifiéLe chiffre est sur la page ; son libellé est formulé par nous.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Box.
- Box utilise BraintrustVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 6 oct. 2026.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.




