Simon Willison explores an early Gemini reasoning model through practical examples.
AI Evaluation
Benchmarks, testing, guardrails, and observation of model or agent behavior.
16 saved linksSearch in this topic →
Saved Links in AI Evaluation
Simon Willison tests QvQ, a visual reasoning model, with example images and questions.
A proxy for experimenting with techniques that change how language model responses are produced.
A framework for defining and optimizing language model programs.