Back to evaluations
Public evaluation

luxury_return_fraud_eval

Evaluates return fraud risk classification accuracy across sample claim scenarios.

Evaluation type
task based
Challenge
Luxury Commerce Fraud Inspection Agent using Claude Agents SDK and Replit Agent
Difficulty
Intermediate
Rigor
Unspecified

Evaluation overview

How the linked challenge is judged: tasks, benchmarks, and criteria count.

Tasks
1
Benchmarks
0
Criteria
0

Task templates

Inputs and expected outputs.

Task 1

luxury_return_fraud_eval

Tests agent ability to spot fraudulent claims based on serial mismatch and item metadata.

Input format

JSON containing original order item metadata, return claim reason, and claim photos metadata.

Output format

JSON containing risk_score, decision, and detected_discrepancies.