Ir al contenido principal
usedby

80%+

Score threshold for internal release

Tal como se publicó en braintrust.dev. Capturado por usedby el 6 oct 2026.

Qué pasó

Box's product managers use Braintrust as the system of record for the datasets, experiments and metrics behind evals of the Box Agent. They run programmatic evals nightly, cluster failures with tags, grade outputs with LLM and code-based graders, and compare models against a fixed baseline dataset.

Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Braintrust y de Box, no nuestras.

Box's path to launch was determined by datasets. Before opening the agent to internal dogfooding, the team built a set of roughly eighty questions covering core functionality and decided there would be no internal release until the agent scored above 80%.

De la página. braintrust.dev, capturada el 6 oct 2026

Lo que dice la historia, y lo que verificamos

Comparamos la historia con su página en línea el 6 oct 2026.

  • La cifra: 80%+VerificadoLa cifra está en la página; su etiqueta es redacción nuestra.
  • El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Box.
  • Box usa BraintrustVerificadoLínea de nivel Confirmado. Última verificación entre todas las fuentes: 6 oct 2026.
  • El resultado en síNo verificadoLo citamos; no lo medimos.

Misma empresa, misma herramienta o mismo sector.

>0.9Eval system macro F1 scoreNavan usa Braintrust. Otro cliente de Braintrust~10 → 0 minsEngineering time to debug an issuePylon usa Braintrust. Otro cliente de Braintrust30-min“Continuous signal, 30-min fix cycles”Rex usa Braintrust. Otro cliente de Braintrust