Back to evaluations
Draft evaluation

AutoGen & Braintrust Trade Finance Audit Agent — evaluation

Evaluates AutoGen multi-agent accuracy and audit trail completeness against trade finance datasets via Braintrust metrics.

Evaluation type
task based
Challenge
AutoGen & Braintrust Trade Finance Audit Agent
Difficulty
Advanced
Rigor
Not declared

The author has not specified a rigor level.

Evaluation overview

How the linked challenge is judged: tasks, benchmarks, and criteria count.

Tasks
1
Benchmarks
0
Criteria
0

Task templates

Inputs and expected outputs.

Task 1

Trade Finance Compliance Check Task

Evaluates multi-agent trade finance document parsing and compliance reporting

Input format

JSON containing trade finance document text and metadata

Output format

JSON containing risk score, list of compliance violations, and agent decision trail