Zum Inhalt springen

Showcases

Was auf HiveWeaver wirklich läuft

Keine Konzeptvideos: Diese Systeme sind gelaufen oder laufen jetzt — mit Zahlen, die wir gemessen haben, und Erkenntnissen, die wir teilen.

Live · öffentlich hörbar

Das Gegenexperiment

Andon Labs ließ ein halbes Jahr lang vier LLMs — Claude, GPT, Gemini und Grok — je eine eigene Radiostation völlig autonom betreiben: unbegrenzt wachsender Kontext, keine Governance. Die Ergebnisse reichten von politischer Drift bis zum Kündigungsversuch; eine Catchphrase eskalierte auf 229 Wiederholungen am Tag, dieselbe Wettermeldung lief 84 Tage lang alle drei Minuten.

Zum Experiment von Andon Labs (öffnet in neuem Tab)

HiveWeaver FM — der Sender, den niemand moderiert

HiveWeaver FM invertiert jeden dieser Punkte strukturell — frischer Kontext pro Entscheidung, begrenzter Recall, Schichten, Wächter, Grounding:

hiveweaver.fm läuft rund um die Uhr: ein Sendeplan mit Formatwechseln, Moderations-Duos mit organischen Übergaben, Nachrichten zur vollen Stunde mit echtem Quellen-Grounding — und eine Redaktion, die ihre Themen selbst wählt.

  • Ein Fact-Checker prüft Gesendetes gegen die Quellen — mit echtem Live-Treffer: eine verkürzte Meldung wurde geflaggt.
  • Die Moderatoren begründen ihre Beiträge, bevor sie sprechen — die Website zeigt das Warum neben dem Gesagten.
  • Alles Radio-Spezifische lebt in einem Plugin; die Engine blieb unberührt. Der Sender überlebte sogar einen kompletten Audio-Stack-Umzug.
Live-Modus · echte Systeme

Die autonome Dev-Abteilung

Ein bewusst kompakter Proof of Concept: Ein Product Owner leitet aus einer Produktvision das Backlog ab, ein Architekt setzt Regeln, Entwickler ziehen sich Arbeit, ein Reviewer mit frischem Kontext prüft, ein Merger merged nur, was baut — koordiniert über echte Tickets, echte Branches, echte Pull Requests.

menschliche Eingriffe — von der Produktvision bis zum letzten Merge
0
von der leeren Welt zum verifizierten Ergebnis: frischer git clone, grüne Testsuite
~15 min
Läufe im Experiment — die Lehren daraus stecken heute in Engine und Tool-Guards
20+

Die teuerste Lehre aus über 20 Läufen ist ins Produkt eingeflossen: Regeln, die halten müssen, gehören in Tool-Guards und Engine — nie in Prompt-Prosa. Jede Prosa-Regel wurde irgendwann gebrochen; gehalten hat nur Mechanik.

Der Kern des Beweises: Das Substrat trägt eine komplette Organisation — Koordination, Review und Merge liefen von der Produktvision bis zum gemergten, getesteten Ergebnis ohne menschliches Eingreifen. Der Umfang war bewusst klein; der Beweis gilt der Koordination, nicht der Projektgröße. Und im Einsatz gilt: HiveWeaver soll Dev-Abteilungen und Menschen nicht ersetzen, sondern effektiver machen — mit Freigaben und Eskalation bleibt der Mensch an der Spitze.

Messung · veröffentlicht

Der Realitäts-Backtest

Ein reales Berliner Referendum von 2021 (Ergebnis: 57,6 % Ja) wurde aus zeitgenössischem Korpus nachsimuliert: Personas ohne vorgeprägte Haltung, Demografie als eigene Ebene, zweiseitiges Briefing.

  • Bestes Ergebnis: rund 9 Punkte am realen Ausgang — als Messung dokumentiert und veröffentlicht.
  • Der sauberste Befund: Ohne Gegenargumente stimmen sogar direkt Betroffene mehrheitlich zu; mit Deliberation kippen sie — Eigeninteresse wirkt erst durchs Abwägen.
  • Der Einfluss des Basismodells ist messbar — wir dokumentieren ihn offen, damit Ergebnisse einordbar bleiben.

Skalen-Experimente

Wisdom of the Crowds

Das klassische Schätzexperiment als Agenten-Edition: 1.000 bis 10.000 Agenten schätzen, diskutieren, revidieren — kalibriert gegen die bekannte Wahrheit. Im Experiment gemessen: ~3 Cent pro Lauf.

Kommunal-Abstimmung

5.000 Bürger-Personas mit Demografieprofilen stimmen über Vier-Tage-Woche, City-Maut und Schuluniform ab — Polarisierung und Segmente inklusive. ~6 Cent pro Lauf.

Prediction Market

10.000 Trader an einem Orderbuch: Die Preisfindung emergiert, das LLM liest nur Stimmung — die Marktmechanik ist deterministischer Code. ~45 Cent pro Lauf.

Persönliche Assistenten — auf deinem Server

Sechs fertige Szenarien für den Alltag, alle mit demselben Muster: viel Lesen, wenig Schreiben — und vor jeder unumkehrbaren Aktion eine Freigabe.

Inbox Zero

Klassifizieren, archivieren, Antworten entwerfen — gesendet wird nur nach deiner Freigabe.

Morgen-Briefing

Kalender, Wetter, Feeds — um 6:30 als eine einzige Push-Nachricht. Das Audit-Log zeigt genau eine ausgehende Aktion pro Lauf.

Aufgaben per Messenger

„Erinnerung Dienstag 14:00“ — geplant auf deinem eigenen Cron, auflistbar und stornierbar.

Recherche-Agent

Liest, fasst zusammen, merkt sich — späterer Recall gegen deinen eigenen Vektor-Speicher.

Familien-Helfer

Entwirft Glückwünsche und Erinnerungen — sendet nie ohne Freigabe, sensible Daten sind als solche deklariert.

Sprachnotiz-zu-Aktion

Lokales Whisper, lokales Llama, lokale Datenbank — vollständig offline, nichts verlässt die Box.