Lokale KI-Agenten: Eigene Hardware oder GPU-Cloud mieten?

Ein KI-Agent braucht mehr Speicher als ein Chat, weil sein Kontext schnell wächst. Wir rechnen nach, wann eine eigene Grafikkarte reicht, ab wann GPU-Stunden in der Cloud günstiger sind und worauf du beim Datenschutz achten musst.

Lokale KI-Agenten: Eigene Hardware oder GPU-Cloud mieten?
Auf einen Blick
  • Agenten brauchen viel Kontext. Ollama empfiehlt für Agenten mindestens 64.000 Tokens. In der Grundeinstellung arbeitet es auf Karten unter 24 GB VRAM nur mit 4.000.
  • Der Kontext kostet VRAM. Bei Llama 3.1 8B belegt der KV-Cache für 64.000 Tokens rechnerisch rund 7,8 GiB. Das ist mehr als das Modell selbst.
  • Eigene Hardware lohnt sich, wenn dein Agent täglich viele Stunden läuft, sensible Daten verarbeitet oder dauerhaft verfügbar sein soll.
  • GPU-Cloud lohnt sich, wenn du nur ab und zu große Modelle testest oder Lastspitzen abfangen musst. RunPod rechnet Pods sekundengenau ab.
  • Beim Datenschutz ist Vorsicht angesagt: RunPod ist ein US-Unternehmen. Es gibt EU-Regionen, aber personenbezogene Daten gehören dort nur mit geprüftem AVV hin.

Einen Chatbot lokal zu starten ist inzwischen trivial. Ein Agent ist etwas anderes. Er liest Dateien, ruft Werkzeuge auf, bekommt deren Ergebnisse zurück und plant den nächsten Schritt. Das alles landet im Kontext. Nach ein paar Runden ist das Kontextfenster voll, das Modell vergisst die Aufgabe oder die Grafikkarte lagert auf den Prozessor aus. Dann wird es zäh.

Deshalb stellt sich bei Agenten die Hardwarefrage anders als beim reinen Chat. Dieser Artikel ergänzt unseren Hardware-Guide für lokale KI um genau diesen Blickwinkel: Was braucht ein Agent wirklich, und ab wann ist gemietete Rechenzeit die vernünftigere Wahl?

Warum brauchen KI-Agenten mehr Speicher als ein Chat?

Weil ein Agent seinen gesamten Arbeitsverlauf im Kontext mitschleppt und jeder Token davon Grafikspeicher belegt. Neben den Modellgewichten liegt im VRAM der sogenannte KV-Cache. Er wächst linear mit der Zahl der Tokens im Kontextfenster.

In einem Chat bleibt der Kontext meist überschaubar: Frage, Antwort, vielleicht ein eingefügter Text. Bei einem KI-Agenten kommen dazu der Systemprompt mit allen Werkzeugbeschreibungen, die Rückgaben jedes Tool-Aufrufs, eingelesene Dokumente und die Zwischenschritte. Wer Werkzeuge über das Model Context Protocol (MCP) anbindet, merkt schnell: Allein die Tool-Definitionen füllen einen spürbaren Teil des Fensters, bevor der Agent überhaupt anfängt.

Ollama ist in seiner Dokumentation deutlich. Aufgaben mit großem Kontext wie Websuche, Agenten und Coding-Werkzeuge sollten auf mindestens 64.000 Tokens eingestellt werden. Seit Version 0.15.5 hängen die Standardwerte vom VRAM ab: unter 24 GiB gibt es 4.000 Tokens, zwischen 24 und 48 GiB sind es 32.000, ab 48 GiB 256.000. Wer also eine 16-GB-Karte hat und nichts umstellt, schickt seinen Agenten mit einem Bruchteil des empfohlenen Kontexts los.

Wie stelle ich die Kontextlänge in Ollama ein?

Über die Umgebungsvariable OLLAMA_CONTEXT_LENGTH beim Serverstart oder über den Regler in den Einstellungen der Ollama-App. Danach zeigt dir ollama ps, mit welchem Kontext das Modell geladen wurde und ob es zu 100 % auf der GPU läuft. Steht dort eine Aufteilung zwischen CPU und GPU, reicht dein VRAM für diese Kombination nicht aus.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve
ollama ps

Noch unentschlossen? Unser Vergleich Ollama vs. LM Studio hilft. Für Agenten im Dauerbetrieb ist ein Server wie in Ollama unter Linux installieren die robustere Basis.

Wie viel VRAM braucht ein lokaler KI-Agent konkret?

Für ein 8B-Modell mit 64.000 Tokens Kontext solltest du mit gut 13 GiB rechnen, bevor Laufzeit-Overhead dazukommt. Eine 16-GB-Karte ist damit knapp, aber machbar. Die Rechnung setzt sich aus zwei Teilen zusammen.

Erstens die Gewichte. Llama 3.1 8B in der Quantisierung Q4_K_M ist in der Ollama-Bibliothek 4,9 GB groß, in Q8_0 sind es 8,5 GB. Warum Quantisierung so viel spart, erklärt unser Artikel GGUF und Quantisierung.

Zweitens der KV-Cache. Den kannst du aus der Modellkonfiguration selbst berechnen: 2 × Anzahl der Schichten × Anzahl der KV-Köpfe × Kopfdimension × Bytes pro Wert. Llama 3.1 8B hat laut seiner config.json 32 Schichten, 8 KV-Köpfe und eine Kopfdimension von 128. Bei 16-Bit-Präzision (2 Bytes) ergibt das 131.072 Bytes pro Token.

KV-Cache von Llama 3.1 8B nach Kontextlänge (eigene Rechnung aus der Modellkonfiguration)
Kontext KV-Cache f16 (Standard) KV-Cache q8_0 KV-Cache q4_0
4.000 Tokensca. 0,5 GiBca. 0,25 GiBca. 0,12 GiB
32.000 Tokensca. 3,9 GiBca. 2,0 GiBca. 1,0 GiB
64.000 Tokensca. 7,8 GiBca. 3,9 GiBca. 2,0 GiB
q8_0 und q4_0 nach Ollama-FAQ mit etwa der Hälfte bzw. einem Viertel des f16-Speichers angesetzt. Ohne Laufzeit-Overhead, gerundet.

Zwei Stellschrauben verändern diese Zahlen deutlich. Mit OLLAMA_KV_CACHE_TYPE=q8_0 halbiert sich der Cache laut Ollama ungefähr, oft der schnellste Weg zu einem stabilen Agenten auf 16 GB. Wie stark die Qualität leidet, musst du selbst testen.

In die andere Richtung wirkt OLLAMA_NUM_PARALLEL. Laut Ollama wächst der Speicherbedarf mit Parallelität mal Kontextlänge. Zwei Agenten parallel auf demselben Modell verdoppeln also den Cache. Bei Multi-Agenten-Setups, wie wir sie im Vergleich Open-Source-KI-Agenten 2026 beschreiben, wird genau das schnell zum Engpass.

Kleine Modelle passen gut in den Speicher, verhaspeln sich aber bei mehrstufigen Tool-Aufrufen eher. Welche Modelle Werkzeugaufrufe unterstützen, steht im Vergleich lokaler LLM-Modelle. Teste deinen Ablauf mit mehreren Tool-Aufrufen am Stück, bevor du Hardware kaufst.

Wann lohnt sich eigene Hardware für KI-Agenten?

Eigene Hardware lohnt sich, wenn dein Agent regelmäßig und lange läuft, mit vertraulichen Daten arbeitet oder jederzeit ohne Wartezeit bereitstehen soll. Der Kaufpreis ist dann auf viele Betriebsstunden verteilt, und die Daten verlassen dein Netz nicht.

Typische Fälle: ein Agent, der nachts Belege sortiert, ein Coding-Assistent für den ganzen Arbeitstag oder ein Recherche-Agent auf deinem lokalen RAG mit eigenen Dokumenten.

Für Agenten zählt vor allem VRAM, weniger die reine Rechenleistung. Eine Karte mit 16 GB trägt ein 8B-Modell mit großzügigem Kontext. 24 GB oder mehr geben dir Luft für größere Modelle oder parallele Anfragen. Und ausreichend Arbeitsspeicher im System sorgt dafür, dass das Laden großer Modelle nicht zum Geduldsspiel wird. Welche Setups wir konkret empfehlen, steht im Kaufratgeber Hardware für lokale KI.

Alternativen sind Geräte mit gemeinsamem Speicher wie der Mac mini M5 Pro oder Mini-PCs mit Ryzen AI Max+ 395. Dort teilen sich System und Grafik den Speicher, für Modell und Kontext bleibt also weniger als angegeben.

Anzeige
ASUS Dual GeForce RTX 5060 Ti 16GB OC Edition
16 GB VRAM: Einstieg für 8B-Modelle mit großem Agenten-Kontext
Bei Amazon ansehen →
MSI GeForce RTX 4090 Gaming X Trio 24G
24 GB VRAM, Vorgängergeneration, Verfügbarkeit schwankt
Bei Amazon ansehen →
MSI GeForce RTX 5090 32G Gaming Trio OC
32 GB VRAM für größere Modelle oder parallele Agenten
Bei Amazon ansehen →
Kingston FURY Beast DDR5 64 GB (2 × 32 GB, 6000MT/s, CL30)
Damit große Modelle zügig geladen werden
Bei Amazon ansehen →
Apple Mac mini mit M5 Pro (24 GB gemeinsamer Speicher)
Kompakte Alternative ohne separate Grafikkarte
Bei Amazon ansehen →
GMKtec EVO-X2 (Ryzen AI Max+ 395, 64 GB)
Mini-PC mit gemeinsamem Speicher für CPU und Grafik
Bei Amazon ansehen →
Affiliate-Links: Kaufst du über diese Links, erhalten wir ggf. eine Provision. Für dich ändert sich der Preis nicht. Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.

Was kostet der Strom für einen lokalen Agenten?

Rechne mit Leistungsaufnahme mal Laufzeit mal Strompreis. Eine Karte mit 450 Watt unter Volllast kostet bei 37 Cent pro Kilowattstunde knapp 17 Cent pro Stunde. 450 Watt gibt NVIDIA als Grafikleistung der RTX 4090 an, 37 Cent ist der vom BDEW für 2026 ermittelte durchschnittliche Haushaltsstrompreis. Für die RTX 5090 nennt NVIDIA 575 Watt.

Das ist die Obergrenze. Ein Agent rechnet nicht durchgehend, zwischen den Schritten wartet er auf Tools oder auf dich. Dafür kommen Prozessor, Mainboard und Netzteilverluste dazu. Miss den tatsächlichen Verbrauch mit einem Zwischenstecker, statt dich auf Datenblätter zu verlassen.

Wann ist eine GPU-Cloud die bessere Wahl?

Die GPU-Cloud ist die bessere Wahl, wenn du große Modelle nur zeitweise brauchst, verschiedene Karten ausprobieren willst oder kurzfristig mehr Kapazität benötigst, als dein Rechner hergibt. Du zahlst dann nur für die Zeit, in der die Karte wirklich läuft.

Ein realistisches Szenario: Du entwickelst deinen Agenten lokal mit einem 8B-Modell. Bevor du dich festlegst, willst du prüfen, ob ein deutlich größeres Modell die Tool-Aufrufe zuverlässiger erledigt. Dafür eine Karte mit 48 oder 80 GB zu kaufen, wäre absurd. Ein paar Stunden Miete sind es nicht.

Bei RunPod lagen die On-Demand-Preise am 15. September 2026 laut Preisseite zum Beispiel bei:

RunPod On-Demand-Preise pro Stunde (Stand 15.09.2026, in US-Dollar)
GPU Community Cloud Secure Cloud
RTX 3090 (24 GB)0,22 $0,50 $
RTX 4090 (24 GB)0,34 $0,74 $
RTX 5090 (32 GB)0,69 $0,99 $
L40S (48 GB)0,79 $1,09 $
A100 PCIe (80 GB)1,19 $1,59 $
H100 PCIe (80 GB)1,99 $2,89 $
Je GPU die PCIe-Variante mit der angegebenen VRAM-Größe. Die SXM-Varianten kosten zum Teil mehr. Preise ändern sich häufig, maßgeblich ist die Anzeige bei RunPod zum Buchungszeitpunkt.

Pods werden sekundengenau abgerechnet. Eine Falle solltest du kennen: den Speicher. Laut Preisseite kostet ein Volume-Disk im Betrieb 0,10 $ pro GB und Monat, im Leerlauf 0,20 $. Ein nur gestoppter Pod mit großem Modell-Volume kostet weiter. Vergessene laufende Pods sind der zweite Klassiker. Deshalb gilt: Aufgabe erledigt, Pod beenden. Mehr zu Stärken und Schwächen steht in unserem RunPod-Test.

Anzeige
Großes Modell nur mal testen?
RunPod: GPU-Stunden mieten, sekundengenau abgerechnet
RunPod ansehen →
Affiliate-Link: Meldest du dich über diesen Link an, erhalten wir ggf. eine Provision. Für dich entstehen keine Mehrkosten. RunPod ist ein US-Anbieter, beachte die Datenschutzhinweise im Artikel.

Wo liegt die Grenze zwischen Kaufen und Mieten?

Die Grenze liegt dort, wo die eingesparten Mietstunden den Kaufpreis einspielen. Die Formel lautet: Kaufpreis geteilt durch (Mietpreis pro Stunde minus Stromkosten pro Stunde). Das Ergebnis sind die Betriebsstunden bis zum Break-even.

Grafikkartenpreise schwanken zu stark, deshalb zeigt die Tabelle, wie viele Stunden sich je 1.000 Euro Hardware gegenüber der Miete rechnen. Strom: 17 Cent pro Stunde wie oben. Die Mietpreise sind Rechenstufen, keine Angebote.

Break-even pro 1.000 € Hardware (Rechenbeispiel, Strom 0,17 €/h)
Mietpreis vergleichbarer GPU Ersparnis pro Stunde Stunden bis Break-even Bei 8 h an 20 Tagen im Monat
0,30 €/h0,13 €ca. 7.700 hca. 48 Monate
0,60 €/h0,43 €ca. 2.300 hca. 15 Monate
0,90 €/h0,73 €ca. 1.400 hca. 9 Monate
Vereinfachte Rechnung: ohne Wiederverkaufswert, restliche Systemkomponenten, Wartung und Speicherkosten in der Cloud. Kostet deine Karte 2.000 €, verdoppeln sich die Stunden.

Die Tabelle zeigt vor allem eines: Gegen die günstigsten Community-Angebote kommt eigene Hardware nur bei sehr hoher Auslastung an. Gegen Secure-Cloud-Preise für größere Karten sieht es deutlich besser aus. Wie du die vollständigen Betriebskosten über mehrere Jahre ansetzt, erklärt unser Glossar zu Total Cost of Ownership.

Ist eine GPU-Cloud wie RunPod DSGVO-konform nutzbar?

Nur eingeschränkt und nur nach eigener Prüfung. RunPod ist ein US-Unternehmen mit Sitz in New Jersey. Es bietet Rechenzentren in der EU an, das ändert aber nichts an der US-Konzernzugehörigkeit. Für personenbezogene Daten brauchst du einen Auftragsverarbeitungsvertrag und eine Einschätzung zum Drittlandbezug.

RunPod schreibt in seiner Dokumentation, man sei für Daten in europäischen Rechenzentrumsregionen DSGVO-konform. Zu den EU-Regionen gehören unter anderem Rumänien, Tschechien, Frankreich, die Niederlande und Schweden. Das ist eine Selbstauskunft des Anbieters. Einen Auftragsverarbeitungsvertrag gibt es: RunPod stellt einen DPA mit EU-Standardvertragsklauseln (Modul 2) bereit, den du ausfüllen, unterschreiben und einreichen musst. Automatisch gilt er nicht. Laut DPA verarbeitet RunPod Daten weltweit, auch in den USA, und sagt bei einer gewählten Region nur „angemessene Bemühungen“ um einen nahegelegenen Server zu. Eine feste EU-Zusage ist das nicht. Hinzu kommt ein Unterschied zwischen den Angeboten: Die Secure Cloud läuft laut RunPod in zertifizierten Rechenzentren geprüfter Partner, die Community Cloud setzt nur auf Container-Isolation. Für alles Sensible ist die Community Cloud damit raus.

Unsere klare Linie: Nutze gemietete GPUs für Tests mit öffentlichen oder synthetischen Daten, für Modellvergleiche und für Benchmarks. Echte Kundendaten verarbeitest du lokal oder bei einem Anbieter, dessen Vertragslage du geprüft hast. Worauf du beim AVV achten musst, fasst unser Überblick AVV für KI-Tools 2026 zusammen.

Eigene Hardware oder GPU-Cloud: Wie sieht der direkte Vergleich aus?

Kriterium Eigene Hardware GPU-Cloud (Secure) GPU-Cloud (Community)
KostenmodellEinmalig plus StromPro Sekunde plus SpeicherPro Sekunde plus Speicher, günstiger
Maximaler VRAMBegrenzt durch Budget und GehäuseBis 80 GB pro Karte und mehrJe nach Verfügbarkeit
DatenhoheitVollständig bei dirUS-Anbieter, EU-Regionen wählbarFremde Hosts, nur Container-Isolation
VerfügbarkeitSofort, rund um die UhrAbhängig vom KontingentSchwankend
AufwandEinrichtung, Updates, AbsicherungPod-Vorlagen, wenig PflegeWie Secure
Passt fürDauerbetrieb, sensible DatenTests großer Modelle, LastspitzenExperimente mit unkritischen Daten

Kann ich lokal und Cloud kombinieren?

Ja, und für viele ist das der vernünftigste Weg: Der Agent läuft im Alltag auf eigener Hardware, große Modelle oder Lastspitzen landen gezielt auf gemieteten GPUs. Technisch ist der Wechsel einfach, weil Ollama eine OpenAI-kompatible Schnittstelle unter /v1 anbietet, laut Doku inklusive Tool-Aufrufen. Dein Agent spricht dann nur mit einer anderen Adresse.

In der Praxis: Du baust den Agenten lokal, bis Ablauf und Werkzeuge stimmen. Für einen Modellvergleich startest du einen Pod mit Ollama, schickst dieselben Testaufgaben durch und beendest ihn danach. Ob der Agent auf einem eigenen Framework oder am Rand über n8n läuft, ist dafür egal.

Wichtig bleibt der Betrieb. Ein Agent mit Werkzeugzugriff auf deinem Server ist ein Dienst wie jeder andere und braucht Updates, Monitoring und eingeschränkte Rechte. Was dabei schiefgehen kann, beschreiben wir in Betriebs-Standards für Selfhosting mit KI-Agenten. Wenn du ganz am Anfang stehst, beginne mit dem Einstiegs-Guide für lokale KI.

Häufige Fragen

Reicht eine Grafikkarte mit 8 GB VRAM für einen lokalen KI-Agenten?

Für erste Versuche mit kleinen Modellen ja, für ernsthafte Agenten-Arbeit selten. Ein 8B-Modell in Q4 belegt bereits rund 5 GB. Für den empfohlenen Kontext von 64.000 Tokens bleibt dann kein Platz, selbst mit quantisiertem KV-Cache wird es sehr eng.

Warum wird mein lokaler Agent nach ein paar Schritten langsam?

Meist ist der Kontext gewachsen und das Modell passt nicht mehr vollständig in den VRAM. Prüfe mit ollama ps, ob ein Teil auf die CPU ausgelagert wird. Abhilfe schaffen ein kleinerer Kontext, OLLAMA_KV_CACHE_TYPE=q8_0, ein kleineres Modell oder mehr VRAM.

Wie viel Kontext braucht ein KI-Agent?

Ollama empfiehlt für Agenten, Websuche und Coding-Werkzeuge mindestens 64.000 Tokens. Wie viel dein Agent tatsächlich braucht, hängt von Anzahl und Umfang der Werkzeuge, den eingelesenen Dokumenten und der Zahl der Schritte ab.

Ist RunPod datenschutzfreundlich?

RunPod ist ein US-Unternehmen. Es bietet EU-Regionen und einen DPA mit Standardvertragsklauseln an, den du aktiv unterschreiben musst. Laut DPA können Daten aber weltweit, auch in den USA, verarbeitet werden. Für personenbezogene Daten brauchst du eine eigene Prüfung, die Community Cloud ist für sensible Daten ungeeignet.

Wie werden GPU-Stunden bei RunPod abgerechnet?

Pods werden laut RunPod sekundengenau abgerechnet. Zusätzlich fallen Speicherkosten an, bei Volumes sogar im Leerlauf. Beende Pods nach getaner Arbeit und lösche nicht mehr benötigte Volumes.

Ab wie vielen Stunden lohnt sich eine eigene Grafikkarte?

Das hängt vom Kaufpreis, vom vergleichbaren Mietpreis und von deinem Strompreis ab. Teile den Kaufpreis durch die Differenz aus Mietpreis und Stromkosten pro Stunde. Bei günstigen Mietangeboten sind schnell mehrere tausend Betriebsstunden nötig.

Kann ich einen lokalen Agenten später in die Cloud verschieben?

Ja. Wenn dein Agent über die OpenAI-kompatible Schnittstelle von Ollama arbeitet, änderst du nur die Serveradresse. Modell, Prompts und Werkzeuge bleiben gleich. Prüfe vorher, welche Daten dabei das eigene Netz verlassen.

× 📊 KI-Reality-Check
Wie nutzt der Mittelstand wirklich KI? 2 Min, anonym. Jetzt mitmachen →