Blog

Notes on building

Infrastructure, AI, tools, and the decisions behind them.

128k Kontext zu reservieren kostet nichts. Ihn zu füllen kostet zwei Drittel.

Zwei RTX 3090, elf Modelle mit identischen Digests, 528 Anfragen ohne Fehler. Einen 128k-KV-Cache zu reservieren ist beinahe umsonst; ihn zu füllen kostet 10 bis 66 Prozent Durchsatz — bei zehn von elf Modellen ohne jede CPU-Auslagerung. Und: ein angeschlossener Bildschirm kostet 1,8 GB nutzbares VRAM.

Venice.ai: KI mit Vorrang für Privatsphäre — Token-Staking statt Abo

Venice.ai betreibt quelloffene Modelle mit Zero-Knowledge-Datenschutz. Keine Protokolle, kein Training mit deinen Daten. Das Staking-Modell des VVV-Tokens gibt dauerhaften KI-Zugang ohne Monatsgebühr. Wie es funktioniert und wo es neben selbstgehostetem Ollama passt.

Wie Tailscale all meine VPN-Konfigurationen ersetzt hat

Wie ich mit Tailscale Homelab, Rechenzentrumsserver und alles dazwischen zu einem verschlüsselten Mesh verbinde. ACLs, MagicDNS, Subnetz-Routing — und warum meine VPS für KI-Inferenz zu Hause anrufen.

Mein KI-Homelab: RTX 3090, Proxmox, Ollama und Tailscale

Ein kompakter Intel NUC mit Proxmox, Ollama und ComfyUI, über ein Tailscale-Mesh mit jedem Server verbunden. Keine Rechnungen für Cloud-GPUs, keine Herstellerbindung, unbegrenzte Inferenz für unter 15 EUR im Monat.