Skip to content
AI·2026

Multi-Model Trading-Assistant mit Live-Charts und Eval-Harness

Next.js 16-App, die fünf AI-Provider (Anthropic, OpenAI, Google, Mistral, xAI) parallel abfragt, Ergebnisse gegen TradingView-artige Lightweight-Charts matcht und via Supabase persistiert. Dashboard mit customisierbarem Grid-Layout, Eval-Harness gegen historisches Ground-Truth.

FinTech / Personal Analytics8-Wochen-SprintMulti-ProviderSupabaseDrizzle

Kontext / Context

Ein Trading-orientierter Analytics-Workflow, der verschiedene AI-Provider gleichzeitig konsultieren soll. Die These: verschiedene Modelle haben verschiedene Blind-Spots, ein Konsens-Layer über mehreren Providern ist robuster als Single-Model. Plus: der Unit-Economics-Druck (Tokens sind teuer) verlangt ein hartes Eval-Framework, nicht nur “Opus ist immer gut”.

Architektur

  • Next.js 16 (App Router) + React 19 als Shell mit React-Query für Data-Fetching und Zustand für UI-State
  • Vercel AI SDK als Multi-Provider-Layer (@ai-sdk/anthropic, openai, google, mistral, xai) mit einheitlichem Streaming-Interface
  • Supabase als Auth + Backing-DB, Drizzle ORM mit Postgres als Query-Layer
  • lightweight-charts für Live-Chart-Rendering (TradingView-Tech, MIT-Lizenz)
  • react-grid-layout für ein benutzerdefinierbares Dashboard-Grid
  • cmpstr für Reconciliation-Logik zwischen Provider-Outputs

Eval-Strategie

  • Ground-Truth-Set: historische Kursbewegungen mit “richtiger” Bewertung (Long/Short/Flat) über ein 12-Monate-Window
  • Pro Provider pro Asset-Klasse: Accuracy, Calibration-Error, Token-Kosten, Latenz P50/P95
  • Weekly-Run gegen das Ground-Truth-Set mit Report-E-Mail
  • CI-Gate: wenn ein Provider unter Threshold fällt, wird er aus der Production-Rotation genommen

Guardrails

  • Kein Autotrading, System ist Assistant, nicht Broker
  • Disclaimer-Layer in jeder UI-Response (“keine Anlageberatung”)
  • Cost-Budget pro User-Session, mit Rate-Limit-Response wenn überschritten
  • PII-Filter auf User-Prompts bevor sie an die Provider gehen

Deliverable

  • Deployte Next.js-App auf Vercel
  • Supabase-Projekt mit Migrations und RLS-Policies
  • Eval-Suite als separates Repo, läuft als GitHub-Action
  • Runbook für Provider-Outage-Handling
  • Monatlicher Cost-und-Accuracy-Report als Dashboard-Export

Take-Aways

  • Multi-Provider + Eval-Gate ist ein echter Qualitäts-Heber, nicht nur ein Feature-Ticker. Konsens-Layer zwischen drei starken Modellen überholt ein Single-Model in allen historischen Asset-Klassen, die wir getestet haben.
  • Anthropic-SDK und OpenAI-SDK haben inzwischen nahezu identische Semantik für Streaming + Tool-Use. Das macht Multi-Provider-Code überschaubar.
  • Eval-Harness muss wirklich laufen. Ein “irgendwann mal gemessen”-Benchmark rottet in zwei Wochen durch Model-Updates.

Bereit für eine echte Bewertung?

Kurzes Scoping-Gespräch, klares Angebot, Start in zwei bis vier Wochen.

Gespräch anfragen

Newsletter

Substance über Schnee

Ein Mail alle zwei Wochen mit einem neuen Blog-Post oder einem technischen Deep-Dive. Kein Clickbait.