Senior Software Engineer — AI Evaluation & Benchmarks
Design and implement coding benchmarks used to evaluate frontier AI models across real-world programming tasks. Build and maintain scalable data pipelines for AI evaluation workflows, analyze AI-generated code for correctness and edge-case failures, and create structured evaluation scenarios that rigorously test reasoning, debugging, and code quality across large multi-language codebases.