128k Kontext zu reservieren kostet nichts. Ihn zu füllen kostet zwei Drittel.
Zwei RTX 3090, elf Modelle mit identischen Digests, 528 Anfragen ohne Fehler. Einen 128k-KV-Cache zu reservieren ist beinahe umsonst; ihn zu füllen kostet 10 bis 66…
Zwei RTX 3090, elf Modelle mit identischen Digests, 528 Anfragen ohne Fehler. Einen 128k-KV-Cache zu reservieren ist beinahe umsonst; ihn zu füllen kostet 10 bis 66…
Ollama 0.32.5 war draußen, meine Workstation lief noch auf 0.31.2, und ich hatte gerade 26 Modelle darauf durchgemessen. Damit ergab sich eine seltene Gelegenheit: dieselbe Maschine,…
In meiner Windows-Workstation steckt eine RTX 3090, die demnächst ausgebaut und als Proxmox-AI-Host neu aufgesetzt wird. Vorher wollte ich für jedes Modell, das ich darauf halte,…
Ein kompakter Intel NUC mit Proxmox, Ollama und ComfyUI, über ein Tailscale-Mesh mit jedem Server verbunden. Keine Rechnungen für Cloud-GPUs, keine Herstellerbindung, unbegrenzte Inferenz für unter…