Back to evaluations
Draft evaluation

Luxury Commerce Fraud Inspection Agent using Claude Agents SDK and Replit Agent — evaluation

Evaluates return fraud risk classification accuracy across sample claim scenarios.

Evaluation type
task based
Challenge
Luxury Commerce Fraud Inspection Agent using Claude Agents SDK and Replit Agent
Difficulty
Intermediate
Rigor
Not declared

The author has not specified a rigor level.

Evaluation overview

How the linked challenge is judged: tasks, benchmarks, and criteria count.

Tasks
1
Benchmarks
0
Criteria
0

Task templates

Inputs and expected outputs.

Task 1

luxury_return_fraud_eval

Tests agent ability to spot fraudulent claims based on serial mismatch and item metadata.

Input format

JSON containing original order item metadata, return claim reason, and claim photos metadata.

Output format

JSON containing risk_score, decision, and detected_discrepancies.