$60–80/hr · Mercor · Part time, 35 hours a week
Evaluate AI model outputs for insurance domain knowledge, design underwriting scenarios, and develop evaluation rubrics.
What you would do
- Evaluate AI-generated insurance content against structured rubrics assessing correctness, judgment, and reasoning quality
- Design challenging, domain-relevant scenarios with accurate solutions grounded in real underwriting and claims practice
- Score AI model outputs using established criteria and provide detailed written feedback explaining your assessments
- Develop and refine evaluation guidelines and rubrics specific to insurance tasks and emerging model capabilities
- Collaborate with peer SMEs to ensure consistent application of scoring standards and identify training data gaps
Who they want
- Minimum 8 years professional insurance experience in underwriting, claims, actuarial work, or risk management at top-tier organizations
- Hands-on background assessing LLM performance using defined criteria and delivering scoring rationale
- Clear career progression demonstrating advancement within insurance field
- Reliable availability for at least 35 hours per week during business days
- Strong verbal and written communication skills with problem-solving and interpersonal capability
Main skills
What the interview asks about
1.Underwriting Judgment & Risk Classification
Insurance AI must replicate nuanced professional judgment about risk acceptability; evaluating whether models demonstrate real underwriting logic versus pattern matching is critical.
For example: “An AI model recommends declining a commercial property policy for a bakery in a flood zone citing high risk. What additional underwriting factors would you evaluate to determine if this recommendation reflects proper risk assessment?”
2.Claims Reasoning & Loss Analysis
Assessing AI competence in claims scenarios requires understanding how adjusters analyze coverage applicability, causation, and policy language in real claim situations.
For example: “Model output addresses a water damage claim by correctly identifying coverage under named-peril language but overlooks a maintenance exclusion mentioned in the policy. How would you assess this output's reasoning quality?”
3.Rubric Application & Scoring Consistency
Calibrating scoring rubrics across multiple evaluators demands that your assessment rationale aligns with established criteria and contributes to reliable training data.
For example: “Two peer SMEs score the same AI output differently within your rubric's range. What would you examine in the model's reasoning to arbitrate which score better reflects underwriting quality?”
4.Complex Scenario Design
Creating challenging scenarios that probe AI capability requires knowing which real underwriting questions expose gaps in domain knowledge versus those with straightforward answers.
For example: “Design an underwriting scenario involving a commercial client with previous losses, regulatory exposure, and unusual coverage requests. What specific underwriting judgments should an AI system demonstrate?”
5.Domain Expertise Translation for AI Researchers
Training AI systems on insurance logic requires translating tacit professional judgment into explicit criteria and examples that non-insurance researchers can understand.
For example: “Explain to an AI researcher unfamiliar with insurance why two coverages with similar policy language might have completely different underwriting implications in practice.”
A task you may get
Evaluate 3-5 AI model outputs on insurance scenarios using provided rubrics, score them with written rationale, and contribute feedback on rubric clarity.
How to prepare
- Review sample AI outputs on insurance topics to understand current model capabilities and limitations in your domain
- Prepare examples from your experience showing good versus poor underwriting judgment and reasoning
- Study how underwriting principles transfer to AI training contexts and what domain knowledge most needs reinforcement
- Consider how to translate your experience into evaluation criteria that non-insurance experts can apply consistently
The facts
- Pay
- $60–80/hr
- Hours
- Part time, 35 hours a week
- Where
- Remote · United States
- Open to
- USA
- Field
- Finance
- Posted
- 7/10/2026
- Places left
- 10
We wrote this page from the public Mercor listing. It may be out of date, so read the full posting before you apply.