Pick up to 3 (provider, model) pairs and diff them side-by-side: quality by task, tokens per second, reliability, $/1M output tokens, context window, tools, streaming.