AI Engineer · KI
Warum der Aufbau einer Eval-Plattform schwieriger ist, als es aussieht — Braintrust
Die meisten Teams beginnen ihre Evaluierungen in einer Tabellenkalkulation. Hier erfahren Sie, was passiert, wenn sie versuchen, darüber hinauszuwachsen. Hossein Niazmandi, der bei Braintrust das Solutions Engineering im Westen leitet, erklärt, warum die Messung der Agentenqualität viel mehr ist, als nur eine Benutzeroberfläche auf eine Tabellenkalkulation zu legen. Er behandelt die zwei Säulen der Agentenqualität, Evaluierungen vor der Produktion und Beobachtbarkeit danach, und warum nicht-deterministische LLMs beides notwendig machen. Dann geht er die Phasen durch, die Teams durchlaufen

Introductie van de bron.
AI Engineer