Skip to content
AI·2026

Multi-model trading assistant with live charts and eval harness

Next.js 16 app querying five AI providers (Anthropic, OpenAI, Google, Mistral, xAI) in parallel, matching results against TradingView-style lightweight charts, persisted via Supabase. Dashboard with customizable grid layout, eval harness against historical ground truth.

FinTech / personal analytics8-Wochen-SprintMulti-ProviderSupabaseDrizzle

Kontext / Context

Ein Trading-orientierter Analytics-Workflow, der verschiedene AI-Provider gleichzeitig konsultieren soll. Die These: verschiedene Modelle haben verschiedene Blind-Spots, ein Konsens-Layer über mehreren Providern ist robuster als Single-Model. Plus: der Unit-Economics-Druck (Tokens sind teuer) verlangt ein hartes Eval-Framework, nicht nur “Opus ist immer gut”.

Architektur

  • Next.js 16 (App Router) + React 19 als Shell mit React-Query für Data-Fetching und Zustand für UI-State
  • Vercel AI SDK als Multi-Provider-Layer (@ai-sdk/anthropic, openai, google, mistral, xai) mit einheitlichem Streaming-Interface
  • Supabase als Auth + Backing-DB, Drizzle ORM mit Postgres als Query-Layer
  • lightweight-charts für Live-Chart-Rendering (TradingView-Tech, MIT-Lizenz)
  • react-grid-layout für ein benutzerdefinierbares Dashboard-Grid
  • cmpstr für Reconciliation-Logik zwischen Provider-Outputs

Eval-Strategie

  • Ground-Truth-Set: historische Kursbewegungen mit “richtiger” Bewertung (Long/Short/Flat) über ein 12-Monate-Window
  • Pro Provider pro Asset-Klasse: Accuracy, Calibration-Error, Token-Kosten, Latenz P50/P95
  • Weekly-Run gegen das Ground-Truth-Set mit Report-E-Mail
  • CI-Gate: wenn ein Provider unter Threshold fällt, wird er aus der Production-Rotation genommen

Guardrails

  • Kein Autotrading, System ist Assistant, nicht Broker
  • Disclaimer-Layer in jeder UI-Response (“keine Anlageberatung”)
  • Cost-Budget pro User-Session, mit Rate-Limit-Response wenn überschritten
  • PII-Filter auf User-Prompts bevor sie an die Provider gehen

Deliverable

  • Deployte Next.js-App auf Vercel
  • Supabase-Projekt mit Migrations und RLS-Policies
  • Eval-Suite als separates Repo, läuft als GitHub-Action
  • Runbook für Provider-Outage-Handling
  • Monatlicher Cost-und-Accuracy-Report als Dashboard-Export

Take-Aways

  • Multi-Provider + Eval-Gate ist ein echter Qualitäts-Heber, nicht nur ein Feature-Ticker. Konsens-Layer zwischen drei starken Modellen überholt ein Single-Model in allen historischen Asset-Klassen, die wir getestet haben.
  • Anthropic-SDK und OpenAI-SDK haben inzwischen nahezu identische Semantik für Streaming + Tool-Use. Das macht Multi-Provider-Code überschaubar.
  • Eval-Harness muss wirklich laufen. Ein “irgendwann mal gemessen”-Benchmark rottet in zwei Wochen durch Model-Updates.

Ready for a real assessment?

Short scoping call, clear proposal, kick-off in two to four weeks.

Start the conversation

Newsletter

Substance over noise

One email every two weeks with a new blog post or a technical deep dive. No clickbait.