Radar van Elk Solutions

AI Engineer · AI

RL verslaan met reflectie: GEPA en Optimize Anything — Lakshya A. Agrawal, GEPA

Na één reflectieronde op slechts drie voorbeelden verdubbelde GEPA de winst die het RL-algoritme GRPO behaalde na 25,000 rollouts. Lakshya A. Agrawal, maker van GEPA en een PhD-student aan UC Berkeley's Sky Computing Lab, legt uit waarom. RL perst een hele rollout samen tot één enkele score. GEPA laat in plaats daarvan een model de volledige trace lezen, inclusief gedachtegangen, tool calls en foutmeldingen, en een betere prompt schrijven. Een Pareto-pool van kandidaat

Introductie van de bron.

AI Engineer