Eine Hall of LLMs: archivierte Open-Source-Sprachmodelle als bespielbare Exponate, in einer Zeitachse geordnet. Jede Plakette zeigt Jahr, Parameter und Lizenz. Farbige Serving-Chips markieren Desktop, Browser, Server, STT, TTS, Plakette und Archiv.
Der Urahn dieser Halle. OpenAI veröffentlichte GPT-2 im Februar 2019 zunächst nur in dieser kleinsten Stufe — 124 Millionen Parameter —, während die größeren Modellgrößen der Familie (bis 1,5 Milliarden Parameter) monatelang zurückgehalten wurden. Der Grund: Sorge vor automatisierter Desinformation und Identitätsbetrug. Erst im November desselben Jahres, nachdem OpenAI "keine belastbaren Missbrauchsfälle" fand, folgte die Vollversion — aus heutiger Sicht fast rührend vorsichtig, gemessen an dem, was Jahre später klaglos freigegeben wurde. Ohne Chat-Format und Instruction-Tuning vervollständigt dieses Modell Text, statt zu antworten. Seine wirren, abschweifenden Ausgaben sind kein Fehler, sondern der Zustand der Kunst von 2019. Ehrlichkeit zur Serving-Lage: nur Plakette (plaque-only). Das installierte @mlc-ai/web-llm-Prebuilt-Katalog enthält keinen GPT-2/gpt2-Eintrag — Browser-Serving wird hier nicht vorgetäuscht. Pädagogische Nachbarn für „kleines frühes Modell“ im Browser: phi-2 oder SmolLM2 (eigene Plaketten).
Kein Chatbot — Speech-to-Text. OpenAIs Whisper (2022) brachte robuste Mehrsprach-Transkription in die Open-Source-Welt; dieses Exponat zeigt die faster-whisper-Implementierung in der Größe medium auf dem Museum-Host (CPU-Sidecar). Lade eine kurze Audio-Aufnahme hoch und lies das Transkript. Kein LLM-Prompt, keine Tools, kein Zugriff auf andere Museums- oder HackVaults-Daten. Rate-limitiert und größenbegrenzt — ein Demo-Pult, kein Diktier-Service.
Lade eine kurze Audiodatei für Whisper Medium hoch (max. 5 MB). Kein Zugriff auf HackVaults-Daten.
2023
Desktop
Mistral 7B v0.1
Lizenz Apache-2.0
·
Params 7B
·
Q Q4_K_M
Der Moment, in dem ein europäisches Startup zeigte, dass es mit den US-Laboren mithalten kann. Am 27. September 2023 veröffentlichte das gerade gegründete französische Unternehmen Mistral AI dieses 7-Milliarden-Parameter-Modell — und es schlug in praktisch allen Benchmarks das fast doppelt so große Llama 2 13B. Der technische Trick: Sliding-Window-Attention, bei der jede Schicht nur die letzten 4.096 Token direkt betrachtet, kombiniert mit Grouped-Query-Attention für schnellere Inferenz. Wichtiger Hinweis zur Redlichkeit dieser Plakette: "v0.1" ist ein reines Basismodell ohne Chat-Feinschliff. Es führt Text fort, statt zu antworten — genau so kam es damals heraus, die instruction-getunte Variante folgte separat. Quantisiert (Q4_K_M) für den Museums-Rechner; läuft auf TimHackX670 (Desktop-Serving) — wenn der Rechner aus ist, schläft das Exponat.
Frag Mistral 7B etwas — keine Tools, kein Zugriff auf HackVaults-Daten, nur eine kurze Unterhaltung.
2023
Browser
TinyLlama 1.1B-Chat-v1.0
Lizenz Apache-2.0
·
Params 1.1B
·
Q Q4_K_M
Das Experiment: Wie weit kommt man mit nur 1,1 Milliarden Parametern, wenn man auf 3 Billionen Token trainiert? Ein akademisches Team (Singapore University of Technology and Design) startete das Training am 1. September 2023 und veröffentlichte das fertige Modell im Januar 2024 — bewusst weit jenseits dessen, was die "Chinchilla"-Skalierungsgesetze als effizient gelten lassen würden. Die Motivation kam aus Llama 2s eigenem Paper: Selbst nach zwei Billionen Token zeigten größere Modelle keine Sättigung. TinyLlama testet, ob das auch für Winzlinge gilt — und liefert den Beweis, dass brauchbare Sprachmodelle auf gewöhnlicher Consumer-Hardware laufen können, nicht nur in Rechenzentren. Apache-2.0, Llama-2-kompatible Architektur, quantisiert (Q4_K_M) — läuft im Browser des Besuchers via WebLLM (WebGPU), nicht auf dem Desktop-Server. Ohne WebGPU fällt das Terminal auf einen ehrlichen Hinweis zurück; es gibt keinen Server-Proxy für dieses Exponat.
Text-to-Speech ohne Cloud: Piper (Rhasspy) synthetisiert Sprache lokal aus ONNX-Stimmen. Diese Plakette zeigt die deutsche High-Quality-Stimme de_DE-thorsten-high auf dem Museum-Host (tts-sidecar, engine piper). Tippe einen kurzen deutschen Satz — du bekommst WAV-Audio zurück. Kein LLM, keine Tools, keine fremden Daten. Länge und Rate sind begrenzt; wenn der Sidecar schläft, bleibt das Pult ehrlich still.
Kurzer Text für Piper TTS (Thorsten) (max. 400 Zeichen). Lokale Piper-Stimme, kein Cloud-TTS.
2023
Browser
RedPajama INCITE Chat 3B Chat-3B-v1
Lizenz Apache-2.0
·
Params 3B
·
Q q4f16_1 (WebLLM)
Together Computers RedPajama-INCITE-Chat-3B — ein frühes offenes Chat-Modell der 3B-Klasse (2023), Apache-2.0. Im Museum als Browser-Exponat via WebLLM/WebGPU; kein Server-Serving. Zeigt, wie früh die Community instruction-getunte 3B-Modelle im Client lauffähig machen wollte.
Zweite deutsche Piper-Stimme im Museum: de_DE-kerstin-low — eine weibliche Low-Quality-Stimme (16 kHz, quality=low laut ONNX-Config) auf dem Museum-Host (tts-sidecar, engine piper, voice_id kerstin). Gegenstück zu Thorsten (high): bewusst ehrlich als leichte, schnelle CPU-Stimme ausgestellt, nicht als Studio-TTS. Tippe einen kurzen deutschen Satz — WAV kommt lokal zurück. Kein LLM, keine Tools, keine fremden Daten. Rate und Textlänge begrenzt.
Kurzer Text für Piper TTS (Kerstin) (max. 400 Zeichen). Lokale Piper-Stimme, kein Cloud-TTS.
2023
Browser
Phi-2 2.7B
Lizenz MIT
·
Params 2.7B
·
Q q4f16_1 (WebLLM)
Microsofts Phi-2 (2023) — ein frühes kleines Research-Modell der Phi-Linie (~2,7B), MIT. Im Museum als Browser/WebLLM-Exponat: das MLC-Prebuilt (prefix phi-2) läuft im Tab via WebGPU, kein Server-Proxy. Pädagogischer Nachbar zum plaketten-only GPT-2: kleines Modell der Vor-ChatGPT-Nachfolge-Generation, das im Client ehrlich bespielbar ist. Ohne WebGPU nur die Plakette, kein Cloud-Fallback.
Ein kleines instruction-getuntes Modell der Qwen2.5-Familie (Alibaba), das hier als Server-Exponat läuft — nicht auf dem Desktop und nicht im Browser, sondern lokal auf dem Museum-Host via Ollama (qwen2.5:3b-instruct, Q4_K_M). Live-Inferenz ist ehrlich: wenn Ollama schläft oder überlastet ist, sagt das Terminal das, statt Cloud-Glätte vorzutäuschen. Sandbox wie bei den Desktop-Exponaten: keine Tools, kein MCP, kein Zugriff auf HackVaults-Daten — nur Plakette und vortrainiertes Wissen. Apache-2.0.
Frag Qwen2.5 3B Instruct etwas — keine Tools, kein Zugriff auf HackVaults-Daten, nur eine kurze Unterhaltung.
2024
Browser
Phi-3.5 Mini mini-instruct
Lizenz MIT
·
Params 3.8B
·
Q q4f16_1 (WebLLM)
Microsofts kompaktes Instruction-Modell der Phi-3.5-Linie — klein genug für den Browser. Hier als WebLLM/WebGPU-Exponat: das quantisierte MLC-Build läuft im Tab des Besuchers, nicht auf dem Server und nicht auf dem Desktop. Ohne WebGPU zeigt das Terminal einen ehrlichen Hinweis statt Cloud-Fallback. MIT-Lizenz.
Metas kleinster Llama-3.2-Instruct-Zwilling — 1 Milliarde Parameter, gebaut für Edge und Browser. Im Museum als WebLLM-Exponat: die Gewichte werden nur im Browser geladen (WebGPU), kein Server-Proxy. Lizenz: Llama 3.2 Community License (Meta). Ohne WebGPU kein Live-Chat, nur die ehrliche Plakette.
Googles Gemma-2-2B instruction-tuned — ein offenes kleines Modell für den Client. Hier Browser/WebLLM: Inferenz im Tab via WebGPU, kein Desktop, kein Ollama. Die Gemma-Nutzungsbedingungen gelten weiterhin; das Museum zeigt nur die curatierte Plakette und den lokalen Terminal-Pfad.
Hugging Face SmolLM2-360M-Instruct — ein Nano-Instruct-Modell deutlich unter 1B Parametern (Apache-2.0). Browser-Exponat via WebLLM (prefix SmolLM2-360M-Instruct im Prebuilt-Katalog). Zeigt Load-Zeit und Antwortqualität am unteren Rand der Hall of LLMs; kein Desktop-, kein Ollama-Pfad. Ohne WebGPU ehrlicher Hinweis.
Browser-Zwilling der Qwen2.5-Story: 0,5B Instruct (Alibaba, Apache-2.0) läuft hier im Tab via WebLLM (prefix Qwen2.5-0.5B-Instruct), während das 3B-Instruct-Exponat auf dem Museum-Host als Server/Ollama steht. Zwei Serving-Pfade, eine Familie — museale Ehrlichkeit statt einheitlicher Cloud-Illusion.
Allen AIs OLMo-2-0425-1B-Instruct — voll offene Research-Linie (Apache-2.0), hier als Browser/WebLLM-Exponat (prefix OLMo-2-0425-1B-Instruct im Prebuilt-Katalog). Gewichte nur im Client (WebGPU); kein Server-Serving. Zeigt die ~1B-Klasse mit offener Herkunft, nicht nur kommerzielle Small-Models.
ARCHIVIERT — nicht live bespielbar. Moonshot AIs Kimi K3 ist das Riesen-Exponat der Halle: 2,8 Billionen Parameter gesamt (~104 Mrd. aktiv pro Token, 16 von 896 Experten), multimodal (image-text-to-text), MoE, 93 Layer, hidden_size 7168, Kontextfenster 1.048.576 Token. Archiv auf dem Desktop-Vault: 118 Dateien / 96 safetensors-Shards, gemessen 1.561,0 GB ≈ 1,56 TB (Format safetensors/compressed-tensors, 8-bit), SHA-256-geprüft 98/98. Quelle: Hugging Face moonshotai/Kimi-K3, gepinnt auf Repo-Commit 9f62e4e9fffbd0a83ddd60e1c209d828994b3569; Manifest-Abgleich HF-API 118/118 größengleich. Lizenz: other (Moonshot-eigene LICENSE). Warum es hier steht: Maßstab für "zu groß für Live-Serving" — museale Ehrlichkeit statt vorgetäuschter Cloud-Chat. Keine Inferenz, kein Terminal, nur Plakette + Größe.