Measure a prompt, don’t vibe it. Add test cases; it runs your prompt, an independent judge scores each output, and suggests a better prompt.
{input}