GulliBench: Measuring Skepticism in Frontier Models

17 pointsposted 5 hours ago
by rigelbm

2 Comments

dvaplima

4 hours ago

I liked approach to evaluating AI behavior, the fact that additional reasoning doesn’t improve performance is quite interesting!