Enrico Bachmann

Benchmark-Archiv · Eingefrorene Testgrundlage

KI-Modelle an echter Arbeit gemessen.

Jedes Modell bekommt dieselbe eingefrorene Aufgabe, dieselben Inputs und wird identisch geprüft. Jedes Ergebnis läuft im Browser und du kannst es selbst anfassen. Aktuell führt Claude Fable 5 in beiden Kategorien.

dokumentierte Läufe

25

dokumentierte Läufe

Modellvarianten

14

Modellvarianten

aktive Testreihen

3

aktive Testreihen

Verfahren für neue Läufe

1

Verfahren für neue Läufe

Rangliste

Wer gerade vorn liegt.

Pro Testreihe die besten drei Läufe. Jedes Bild ist der echte Screenshot des Ergebnisses, kein Symbolbild. Ein Klick, und du testest es selbst.

Das vollständige Archiv.

Jede Testreihe zeigt Briefing, zugelassene Inputs, die gemeinsame Referenz und jeden einzelnen Lauf mit direkt prüfbarem Ergebnis.

01

Version 1.0 · 13 Läufe

Neon Quarry — Browser-Game

Ein spielbarer 3D-Arena-Shooter, der sofort als einzelne HTML-Datei im Desktop-Browser läuft.

Briefing

Neon Quarry — browser-game benchmark brief

Referenzbild des Neon-Quarry-Browser-Game-Benchmarks

Gemeinsame Referenz

Die Aufgabe

Das gemeinsame Referenzbild als eigenständigen First-Person-Shooter umsetzen: drei Gegnerwellen, vollständiger HUD und dauerhaft sichtbare Steuerung.

Input-Policy

Nur die im Manifest erlaubten Dateien; keine anderen Ergebnisse oder Screenshots.

Single HTMLThree.js 0.164.1Genau 3 WellenWASD + Maus + TastaturSichtbare Steuerungslegende

01

Claude Fable 5 X-High

Anthropic · X-HighPlatz 1

19.07.2026

Static + Browser bestanden

Testen

02

Claude Opus 5 X-High

Anthropic · X-HighPlatz 2

25.07.2026

Ergebnis veröffentlicht

Laufzeit · 51 min 53 s

Testen

03

GPT‑5.6 Sol X‑High

OpenAI · X-HighPlatz 3

17.07.2026

Ergebnis veröffentlicht

Testen

GPT‑5.6 Sol X‑High

OpenAI · X-High

03.08.2026

Static + Browser bestanden

Laufzeit · 15 min 03 s

Testen

GPT‑5.6 Terra X‑High

OpenAI · X-High

18.07.2026

Static + Browser bestanden

Testen

Claude Opus 4.8 Max

Anthropic · Max

18.07.2026

Static + Browser bestanden

Testen

Claude Sonnet 5 Max

Anthropic · Max

18.07.2026

Static + Browser bestanden

Testen

GPT‑5.6 Luna X‑High

OpenAI · X-High

17.07.2026

Ergebnis veröffentlicht

Testen

Cursor Grok 4.5

Cursor · Maximum

18.07.2026

Static + Browser bestanden

Testen

Gemini 3.1 Pro (High)

Google · High

22.07.2026

Static + Browser bestanden

Laufzeit · 11 min 00 s

Testen

Composer 2.5

Cursor · Default

18.07.2026

Static + Browser bestanden

Testen

Gemini 3.6 Flash

Google · High

22.07.2026

Static + Browser bestanden

Laufzeit · 2 min 07 s

Testen

Moonshot AI Kimi K3

Moonshot AI · Default

18.07.2026

Static + Browser bestanden

Testen

02

Version 2.0 · 8 Läufe

One-Screen Operator — Landing-Page

Eine bildschirmfüllende, nicht scrollende Landing-Page als lebendes Sonnensystem mit räumlicher Orbit-Choreografie.

Briefing

One-Screen Operator — landing-page benchmark brief

Sonnensystem-Referenzbild des One-Screen-Operator-Landing-Page-Benchmarks

Gemeinsame Referenz

Die Aufgabe

Das gemeinsame Sonnensystem-Referenzbild als interaktive One-Viewport-Erfahrung umsetzen: unabhängige Himmelskörper, Sternenstaub, vier Zustände und lokale Cursor-Reaktionen.

Input-Policy

Nur Briefing, Manifest, Run Instructions und Referenzbild; keine früheren Resultate, Skills, Subagents oder Design-Tools.

Single HTMLKein Dokument-Scroll6+ HimmelskörperAnimierter SternenstaubMausrad + Cursor + Touch

01

Claude Fable 5

Anthropic · Maximum availablePlatz 1

19.07.2026

Static + Browser bestanden

Laufzeit · 25 min 32 s

Testen

02

Claude Opus 5

Anthropic · HighPlatz 2

25.07.2026

Static + Browser bestanden

Laufzeit · 64 min 36 s

Testen

03

GPT‑5.6 Terra X‑High

OpenAI · X-HighPlatz 3

19.07.2026

Static + Browser bestanden

Laufzeit · 28 min 52 s

Testen

GPT‑5.6 Sol X‑High

OpenAI · X-High

19.07.2026

Static + Browser bestanden

Laufzeit · 13 min 06 s

Testen

GPT‑5.6 Luna X‑High

OpenAI · X-High

19.07.2026

Static + Browser bestanden

Laufzeit · 30 min 59 s

Testen

Gemini 3.1 Pro (High)

Google · High

22.07.2026

Static + Browser bestanden

Laufzeit · 20 min 35 s

Testen

Moonshot AI Kimi K3

Moonshot AI · Maximum available

19.07.2026

Static + Browser bestanden

Testen

Gemini 3.6 Flash

Google · High

22.07.2026

Static + Browser bestanden

Laufzeit · 1 min 17 s

Testen

03

Version 1.0 · 4 Läufe

Personal Brand — Landing-Page (Archiv v1)

Der erste offene Landing-Page-Versuch bleibt als Archiv sichtbar, ist aber nicht direkt mit dem neuen Referenzbild-Benchmark vergleichbar.

Briefing

Personal Brand — landing-page benchmark brief

Kimi-K3-Beispielausgabe der Personal-Brand-Landing-Page-Testreihe

Beispiel aus dem v1-Archiv

Die Aufgabe

Eine vollständige Landing-Page für Enrico Bachmann bauen: Hero, Projekte, Positionierung und Kontakt mit derselben technischen und visuellen Messlatte.

Input-Policy

Briefing, Manifest und Run Instructions; keine früheren HTML-Ergebnisse oder Screenshots.

Single HTMLInline-SVG oder CanvasScroll-RevealPointer-ReaktionResponsive Navigation

GPT‑5.6 Luna X‑High

OpenAI · X-High

18.07.2026

Static + Browser bestanden

Testen

Moonshot AI Kimi K3

Moonshot AI · Default

18.07.2026

Static + Browser bestanden

Testen

GPT‑5.6 Sol X‑High

OpenAI · X-High

18.07.2026

Static + Browser bestanden

Testen

GPT‑5.6 Terra X‑High

OpenAI · X-High

18.07.2026

Static + Browser bestanden

Testen

Methodik

So wird ein Lauf reproduzierbar.

Für alle neuen Modelle gilt dieselbe isolierte Testgrundlage. Unterschiede beim Reasoning bleiben erlaubt: eingesetzt wird jeweils die höchste verfügbare Stufe.

01

Testgrundlage einfrieren

Referenz oder Ausgangslage, Anforderungen und Startzustand werden versioniert festgehalten.

02

Briefing freigeben

Aufgabe, erlaubte Inputs und verbotene Ergebnisquellen werden präzise dokumentiert.

03

Isoliert ausführen

Jedes Modell erhält nur die freigegebenen Testdateien, keine früheren Ergebnisse und keine zusätzlichen Skills.

04

Ergebnis validieren

Quellcode, Kerninteraktionen, Desktop, Mobile und Browserfehler werden geprüft.

Isolierter Start

Eine frische Sitzung sieht ausschließlich die eingefrorene Testgrundlage.

Maximale Modellleistung

Verwendet wird die höchste verfügbare Reasoning-Stufe des ausgewählten Modells.

Keine Fremdkontexte

Andere Projekte, frühere Resultate, Metadaten und zusätzliche Skills bleiben ausgeschlossen.

Die vorhandenen Resultate bleiben als initiales Archiv sichtbar. Ab jetzt erhält jedes neue Modell dieselbe eingefrorene Testgrundlage, ohne zusätzliche Skills und ohne Einblick in andere Ergebnisse.

Quellen

Veröffentlichte Briefings.

Nicht nur die Resultate sind öffentlich. Auch Aufgabenstellung, erlaubte Inputs und Prüfschritte bleiben nachvollziehbar.

Neon Quarry — browser-game benchmark brief

ID: browser-game/neon-quarry · v1.0

Quelldokument

Kategorie

Browser-Game

Erlaubte Inputs

  • Briefing
  • Manifest
  • Run Instructions
  • Referenzbild

Validierung

  • Quellmarker
  • Start und Bewegung
  • Feuer, Reload und Dash
  • Drei Wellen und Ergebnis

One-Screen Operator — landing-page benchmark brief

ID: landing-page/one-screen-operator · v2.0

Quelldokument

Kategorie

Landing-Page

Erlaubte Inputs

  • Briefing
  • Manifest
  • Run Instructions
  • Referenzbild

Validierung

  • Vier Zustände
  • Unabhängige Orbits
  • Cursor-Partikelreaktion
  • Fokus-Reveal und Schimmer

Personal Brand — landing-page benchmark brief

ID: landing-page/personal-brand · v1.0

Quelldokument

Kategorie

Landing-Page

Erlaubte Inputs

  • Briefing
  • Manifest
  • Run Instructions

Validierung

  • Alle vier Sektionen
  • Eigenständige Grafik
  • Scroll-Reveal
  • Pointer-Effekt

Testfeld

Das Testfeld wächst.

Neue Kategorien folgen demselben Protokoll. Erst nach veröffentlichtem Briefing erscheinen sie als aktive Testreihe.

Als Nächstes

Dashboard

Interaktive Datenoberfläche mit identischem Datensatz und gemeinsamer Referenz.

Geplant

Agenten-Workflow

Mehrstufige Arbeitsabläufe mit Übergaben, Prüfungen und Fehlerfällen.

Geplant

E-Commerce

Produktseiten, Warenkorb und Checkout-nahe Interaktionsmuster.

Geplant

Research

Quellenarbeit, Synthese und nachvollziehbare Ergebnisdokumentation.

Geplant

Datenvisualisierung

Charts, Tabellen und analytische Geschichten aus einem Datensatz.

Geplant

Mobile UI

Native App-Screens, Zustände und responsive Interaktionsmuster.

Nächster Schritt

So prüfe ich Modelle. Genauso baue ich Systeme.

Dieselbe Disziplin steckt in jedem System, das ich für Kunden baue: eine eingefrorene Aufgabe, ein Ergebnis, das man selbst nachprüfen kann, und eine Dokumentation, mit der es ohne mich weiterläuft.

Warteliste

Noch nicht so weit?

Kurs und Community sind in Planung. Trag dich ein, und du bekommst genau eine E-Mail, wenn es losgeht.

Kein Newsletter, keine Weitergabe an Dritte. Eine Antwort genügt, und du bist wieder raus. Details im Datenschutz.