Back to evaluations
Draft evaluation
AutoGen & Braintrust Trade Finance Audit Agent — evaluation
Evaluates AutoGen multi-agent accuracy and audit trail completeness against trade finance datasets via Braintrust metrics.
Evaluation type
task based
Challenge
AutoGen & Braintrust Trade Finance Audit Agent
Difficulty
Advanced
Rigor
Not declared
The author has not specified a rigor level.
Evaluation overview
How the linked challenge is judged: tasks, benchmarks, and criteria count.
Tasks
1
Benchmarks
0
Criteria
0
Task templates
Inputs and expected outputs.
Task 1
Trade Finance Compliance Check Task
Evaluates multi-agent trade finance document parsing and compliance reporting
Input format
JSON containing trade finance document text and metadata
Output format
JSON containing risk score, list of compliance violations, and agent decision trail