Back to evaluations
Draft evaluation
Luxury Commerce Fraud Inspection Agent using Claude Agents SDK and Replit Agent — evaluation
Evaluates return fraud risk classification accuracy across sample claim scenarios.
Evaluation type
task based
Challenge
Luxury Commerce Fraud Inspection Agent using Claude Agents SDK and Replit Agent
Difficulty
Intermediate
Rigor
Not declared
The author has not specified a rigor level.
Evaluation overview
How the linked challenge is judged: tasks, benchmarks, and criteria count.
Tasks
1
Benchmarks
0
Criteria
0
Task templates
Inputs and expected outputs.
Task 1
luxury_return_fraud_eval
Tests agent ability to spot fraudulent claims based on serial mismatch and item metadata.
Input format
JSON containing original order item metadata, return claim reason, and claim photos metadata.
Output format
JSON containing risk_score, decision, and detected_discrepancies.