Evaluating AI models through audio assessments as a contractor for AI benchmark evaluation project. Designing training data and auditing conversational AI outputs remotely.
Responsibilities
Operate autonomously to design complex evaluation frameworks and provide structured training data.
Role-Play Scenario Execution: Creating and executing complex, role-play-based evaluation scenarios that simulate realistic customer service interactions across travel, finance, and technical support domains.
Model Performance Auditing: Evaluating AI model performance across standardized qualitative and quantitative metrics, focusing strictly on task completion accuracy, conversational naturalness, and audio comprehension.
Technical Metric Evaluation: Assessing the model's basic computer programming literacy, including its understanding of JSON structures, functions, methods, and ability to reason about structured data within a support context.
Representative Dataset Generation: Contributing to the development of diverse, high-quality audio datasets that accurately reflect real customer expectations for clarity, efficiency, and natural conversational flow.
Requirements
Demonstrable professional expertise in complex customer support, technical troubleshooting, or conversational AI evaluation.
Native or bilingual proficiency in the target language, including fluency across all language skills (reading, listening, writing, and speaking), alongside strong analytical and verbal communication skills to confidently conduct simulated customer support role-plays.
Basic computer programming literacy, specifically a comfortable understanding of JSON structures, functions, methods, and simple logic.
A meticulous, detail-oriented approach to working with structured prompts, complex evaluation rubrics, and technical guidelines.
Required Equipment: Access to a high-quality microphone to ensure clean, reliable audio input during voice evaluations.
Benefits
As a contractor you’ll supply a secure computer and high‑speed internet; company‑sponsored benefits such as health insurance and PTO do not apply.
GHL and AI automation manager building outbound, nurture, and conversational AI systems. Supporting Jumpfactor’s digital marketing campaigns for MSP and IT clients.
Research Director analyzing integration, API management, and AI - enablement markets for IDC, a global technology intelligence provider. Forecasting growth, advising clients, and presenting insights to technology leaders.
Director shaping Desjardins’ Personal Services data, analytics, and AI strategy. Leading transformation, governance, executive partnerships, and high - impact use cases for a cooperative financial group.
AI solutions lead rebuilding Instacart’s grocery - delivery Marketing processes with agentic workflows. Driving adoption, measurable impact, and cross - functional AI planning.
Director leading Desjardins’ AI, data and analytics strategy for Personal Services. Driving data transformation, executive decisions, advanced analytics and responsible governance.
Senior AI Solutions Analyst guiding Desjardins Group’s financial services sectors in responsible productivity AI adoption. Assessing use cases, value, risks and Microsoft AI solutions.
AI Safety Red Teamer stress - testing Mercor’s frontier AI models. Identifying vulnerabilities, jailbreaks, hallucinations, and policy failures through adversarial evaluation.
AVP leading AI transformation, including fraud detection, for Manulife, a global financial services provider. Driving secure, governed Classical, Generative, and Agentic AI solutions across Corporate Functions.
Generative AI Analyst validating Canadian French translations for Welo Data, a global AI data company. Reviewing and annotating multilingual AI - generated content for training and quality improvement.
Senior engineers evaluating AI coding - agent interactions for G2i. Assessing reasoning, explanations, outputs, and engineering judgment across Codex, Claude Code, and Cursor.