Multi-model trading assistant with live charts and eval harness
Next.js 16 app querying five AI providers (Anthropic, OpenAI, Google, Mistral, xAI) in parallel, matching results against TradingView-style lightweight charts, persisted via Supabase. Dashboard with customizable grid layout, eval harness against historical ground truth.
Kontext / Context
Ein Trading-orientierter Analytics-Workflow, der verschiedene AI-Provider gleichzeitig konsultieren soll. Die These: verschiedene Modelle haben verschiedene Blind-Spots, ein Konsens-Layer über mehreren Providern ist robuster als Single-Model. Plus: der Unit-Economics-Druck (Tokens sind teuer) verlangt ein hartes Eval-Framework, nicht nur “Opus ist immer gut”.
Architektur
- Next.js 16 (App Router) + React 19 als Shell mit React-Query für Data-Fetching und Zustand für UI-State
- Vercel AI SDK als Multi-Provider-Layer (
@ai-sdk/anthropic,openai,google,mistral,xai) mit einheitlichem Streaming-Interface - Supabase als Auth + Backing-DB, Drizzle ORM mit Postgres als Query-Layer
lightweight-chartsfür Live-Chart-Rendering (TradingView-Tech, MIT-Lizenz)react-grid-layoutfür ein benutzerdefinierbares Dashboard-Gridcmpstrfür Reconciliation-Logik zwischen Provider-Outputs
Eval-Strategie
- Ground-Truth-Set: historische Kursbewegungen mit “richtiger” Bewertung (Long/Short/Flat) über ein 12-Monate-Window
- Pro Provider pro Asset-Klasse: Accuracy, Calibration-Error, Token-Kosten, Latenz P50/P95
- Weekly-Run gegen das Ground-Truth-Set mit Report-E-Mail
- CI-Gate: wenn ein Provider unter Threshold fällt, wird er aus der Production-Rotation genommen
Guardrails
- Kein Autotrading, System ist Assistant, nicht Broker
- Disclaimer-Layer in jeder UI-Response (“keine Anlageberatung”)
- Cost-Budget pro User-Session, mit Rate-Limit-Response wenn überschritten
- PII-Filter auf User-Prompts bevor sie an die Provider gehen
Deliverable
- Deployte Next.js-App auf Vercel
- Supabase-Projekt mit Migrations und RLS-Policies
- Eval-Suite als separates Repo, läuft als GitHub-Action
- Runbook für Provider-Outage-Handling
- Monatlicher Cost-und-Accuracy-Report als Dashboard-Export
Take-Aways
- Multi-Provider + Eval-Gate ist ein echter Qualitäts-Heber, nicht nur ein Feature-Ticker. Konsens-Layer zwischen drei starken Modellen überholt ein Single-Model in allen historischen Asset-Klassen, die wir getestet haben.
- Anthropic-SDK und OpenAI-SDK haben inzwischen nahezu identische Semantik für Streaming + Tool-Use. Das macht Multi-Provider-Code überschaubar.
- Eval-Harness muss wirklich laufen. Ein “irgendwann mal gemessen”-Benchmark rottet in zwei Wochen durch Model-Updates.