Ir al contenido principal
usedby

Tal como se publicó en braintrust.dev. Capturado por usedby el 6 oct 2026.

Qué pasó

Cloudflare's Agent Experience team uses Braintrust to evaluate its dashboard agent, running an LLM-as-a-judge over whole conversations to score resolution, gating skill, prompt and recipe changes in CI/CD, and benchmarking sub-agents against models of varying capacity.

Resumen escrito por usedby a partir de la página de origen, en inglés. Las cifras son de Braintrust y de Cloudflare, no nuestras.

The dashboard agent's behavior lives in skills, recipes, and prompts, and every change runs through evals in CI/CD. Cloudflare built a shared component, now used across platform internals, that measures skill performance before and after a change.

De la página. braintrust.dev, capturada el 6 oct 2026

Instead of shipping changes, measuring them in production, and going back to the drawing board, we get to iterate directly in development, see how it performs, and then ship it to production.

Kylie Czajkowski, Agent Experience Manager, Cloudflare. Fuente, capturada el 6 oct 2026

Lo que dice la historia, y lo que verificamos

Comparamos la historia con su página en línea el 6 oct 2026.

  • El pasaje citado arribaVerificadoCopiado palabra por palabra de la página, cerca del nombre de Cloudflare.
  • Cloudflare usa BraintrustVerificadoLínea de nivel Confirmado. Última verificación entre todas las fuentes: 6 oct 2026.
  • El resultado en síNo verificadoLo citamos; no lo medimos.

Misma empresa, misma herramienta o mismo sector.

80%+Score threshold for internal releaseBox usa Braintrust. Otro cliente de Braintrust>0.9Eval system macro F1 scoreNavan usa Braintrust. Otro cliente de Braintrust75 percent“75 percent reduction in incident investigation time”Zscaler usa Resolve. Mismo sector: Ciberseguridad