Independent contractor designing complex evaluation frameworks for AI audio models. Focusing on role-play scenarios, auditing AI models, and generating training datasets.
Responsibilities
Operate autonomously to design complex evaluation frameworks and provide structured training data.
Role-Play Scenario Execution: Creating and executing complex, role-play-based evaluation scenarios that simulate realistic customer service interactions.
Model Performance Auditing: Evaluating AI model performance across standardized qualitative and quantitative metrics.
Technical Metric Evaluation: Assessing the model's basic computer programming literacy.
Representative Dataset Generation: Contributing to the development of diverse, high-quality audio datasets.
Requirements
Demonstrable professional expertise in complex customer support, technical troubleshooting, or conversational AI evaluation.
Native or bilingual proficiency in the target language, including fluency across all language skills (reading, listening, writing, and speaking).
Strong analytical and verbal communication skills to confidently conduct simulated customer support role-plays.
Basic computer programming literacy, specifically a comfortable understanding of JSON structures, functions, methods, and simple logic.
A meticulous, detail-oriented approach to working with structured prompts, complex evaluation rubrics, and technical guidelines.
Required Equipment: Access to a high-quality microphone to ensure clean, reliable audio input during voice evaluations.
Benefits
Company-sponsored benefits such as health insurance and PTO do not apply
AVP leading AI transformation, including fraud detection, for Manulife, a global financial services provider. Driving secure, governed Classical, Generative, and Agentic AI solutions across Corporate Functions.
Generative AI Analyst validating Canadian French translations for Welo Data, a global AI data company. Reviewing and annotating multilingual AI - generated content for training and quality improvement.
Senior engineers evaluating AI coding - agent interactions for G2i. Assessing reasoning, explanations, outputs, and engineering judgment across Codex, Claude Code, and Cursor.
Manager integrating workforce management with AI transformation at TD, a major North American bank. Connecting financial, operational, and workforce planning across customer operations.
Search +AI Discovery Manager leading enterprise SEO, AI - search strategy, and client advisory for dentsu, a global integrated marketing agency. Mentoring North American SEO teams and shaping innovative search methodologies.
Director leading Homebase’s data engineering, data science, and applied AI teams. Building trusted data infrastructure and AI - powered tools for 150,000+ small businesses.
AI Solution Specialist helping greenhouse growers adopt Source.ag’s AI - powered crop technology. Building dashboards, automations, and custom tools while translating greenhouse insights into product improvements.
Senior Advisor designing and integrating generative AI solutions for Desjardins, North America’s largest cooperative financial group. Driving adoption through training, change management and scalable AI practices.
Strategy and management consultant creating complex business scenarios and evaluating AI outputs. Supporting Gramian Consultancy’s IT talent solutions through rigorous consulting analysis and executive deliverables.
Gartner Director Analyst shaping AI - driven technology operations guidance for CIOs. Conducting research, advising executives, and presenting modernization strategies to global clients.