>0.9
Eval system macro F1 score
Tel que publié sur braintrust.dev. Capturé par usedby le 6 oct. 2026.
Ce qui s’est passé
Navan built Miles, an AI voice agent that calls hotels to confirm bookings and provide payment details, and uses Braintrust to log every call and run automated evaluations that classify call outcomes. Calls needing human follow-up are surfaced in a filtered Braintrust dashboard for the payment operations team.
Résumé rédigé par usedby à partir de la page source, en anglais. Les chiffres sont ceux de Braintrust et de Navan, pas les nôtres.
- 0.56 to 0.89“improving from 0.56 to 0.89 through iterative refinement”
- 200 calls“Couldn't scale beyond 200 calls”
The team achieved over 0.9 macro F1 score across all control groups for their evaluation system, ensuring that their automated quality checks match human judgment with high accuracy.
Eval-driven development is the new test-driven development. Any projects that we take up, the first step is identifying the eval set.
Ce que dit le témoignage, et ce que nous avons vérifié
Nous avons comparé le témoignage à sa page en ligne le 6 oct. 2026.
- Le chiffre : >0.9VérifiéLe chiffre est sur la page ; son libellé est formulé par nous.
- L’extrait cité plus hautVérifiéCopié mot pour mot depuis la page, près du nom de Navan.
- Navan utilise BraintrustVérifiéLigne de niveau Confirmé. Dernière vérification, toutes sources confondues : 6 oct. 2026.
- Le résultat lui-mêmeNon vérifiéNous le citons ; nous ne l’avons pas mesuré.




