
KI Assistent auf eigenem Server: GPU brauchst du nicht
Ruwen Bädorf··7 Min. Lesezeit
Ein KI Assistent auf eigenem Server ist ein Agent wie Hermes, der auf einem kleinen Mietserver läuft und arbeitet, während dein Rechner aus ist. Die Denkarbeit übernimmt weiter dein bestehender KI-Zugang, deshalb reicht der günstigste Linux-Server ohne Grafikkarte.
Ein KI Assistent auf eigenem Server ist ein Programm wie Hermes, das auf einem kleinen Mietserver läuft und weiterarbeitet, während dein Rechner aus ist. Die Denkarbeit erledigt weiterhin ein Modell wie ChatGPT über deinen bestehenden Zugang, deshalb genügt der günstigste Linux-Server ohne Grafikkarte.
Das ist der ganze Unterschied zwischen einem Chatfenster und einem Assistenten. Im Chatfenster passiert nur etwas, solange du davor sitzt. Auf dem Server passiert auch dann etwas, wenn du schläfst.
Ich zeige dir in diesem Beitrag, wie du dir das in fünf Schritten aufbaust, was es wirklich kostet und an welchen drei Stellen es bei den meisten hakt.
Den kompletten Ablauf habe ich auch als Video bei Instagram gezeigt: das Reel dazu findest du auf @ruwen.ai.
🔥 Willst du genau das Setup, mit dem das hier läuft? Im Jarvis-Bauplan steht der komplette Ablauf zum Nachbauen. → Guide holen
Warum ein KI Assistent auf eigenem Server mehr schafft als ein Chatfenster
Der Grund ist unspektakulär: Es ist eine Frage des Ortes, nicht der Intelligenz.
Dein Chatfenster kennt keine Uhrzeit. Es wartet darauf, dass du etwas eintippst, und danach schläft es wieder ein. Ein Assistent auf einem Server hat dagegen einen Wecker, einen Kalender und einen Posteingang.
Genau deshalb sehen so viele selbstgebaute Assistenten beeindruckend aus und bringen trotzdem nichts. Sie sitzen auf dem Laptop, der abends zugeklappt wird. Was um sieben Uhr morgens passieren sollte, passiert dann eben nicht.
Ein Server kostet dich im Gegenzug ein paar Euro im Monat und eine Stunde Einrichtung. Danach ist der Unterschied der zwischen einem Werkzeug und einem Mitarbeiter.
Der Denkfehler: KI Assistent auf eigenem Server heißt nicht eigenes Modell
Die meisten Anleitungen zu diesem Thema meinen etwas anderes als ich. Sie meinen: Sprachmodell selbst betreiben, damit keine Daten das Haus verlassen. Das ist ein legitimes Ziel, aber es ist ein teures.
Für ein eigenes Modell brauchst du eine Grafikkarte im Server. Ein Anbieter-Vergleich aus dem Jahr 2026 nennt dafür einen Hetzner-GPU-Server ab rund 150 Euro im Monat (skill-sprinters.de). Dazu kommt, dass du dich um Modelle, Treiber und Aktualisierungen selbst kümmerst.
Es gibt einen zweiten Weg, und der ist für Selbstständige der sinnvollere. Du lässt nur den Agenten auf deinem Server laufen, also das Programm, das denkt, plant, Werkzeuge bedient und sich Dinge merkt. Das eigentliche Rechnen holt sich dieses Programm bei einem Modellanbieter, genau wie dein Chatfenster es auch tut.
Damit fällt der teuerste Teil weg. Der Server muss nichts können außer wach bleiben.
| Agent auf dem Server, Modell in der Cloud | Modell komplett selbst betreiben | |
|---|---|---|
| Server | kleinster Linux-Tarif, keine Grafikkarte | Server mit GPU |
| Kosten pro Monat | wenige Euro plus dein bestehender KI-Zugang | ab etwa 150 Euro nur für die Hardware |
| Einrichtung | ein Installationsbefehl | Modelle, Treiber, Aktualisierungen selbst pflegen |
| Deine Daten | gehen wie bisher an deinen Modellanbieter | bleiben auf deinem Server |
| Für wen | Selbstständige und kleine Teams | Firmen mit Datenschutzauflagen |
Wenn du keine Auflage hast, die dich zwingt, ist die linke Spalte der Weg. Sie bringt dir den Nutzen, um den es eigentlich geht, ohne den Betriebsaufwand.
So richtest du einen KI Assistenten auf dem eigenen Server ein
Ich nehme hier Hermes, einen offenen Agenten von Nous Research. Er steht unter MIT-Lizenz, kostet nichts und ist seit Februar 2026 verfügbar (hermes-agent.org). Die Schritte sehen bei anderen Agenten ähnlich aus, die Befehle unterscheiden sich.
- Server mieten.
Ein kleiner Linux-Tarif mit Ubuntu reicht.
Nimm den günstigsten, den du findest, und richte dir einen eigenen Benutzer statt
rootein. - Agenten installieren.
Ein einziger Befehl im Terminal genügt, der Rest läuft von allein.
Danach kennt dein Server den Befehl
hermes. - Modell verbinden. Hier entscheidet sich, ob du monatlich eine Überraschung auf der Rechnung hast. Ich komme gleich darauf zurück.
- Wissen einfüllen. Erzähl ihm einmal, wer du bist, was du verkaufst und woran du gerade arbeitest. Hermes behält das über Sitzungen hinweg, du musst es also nur einmal tun.
- Kanal anschließen. Verbinde ihn mit dem Ort, an dem du sowieso schreibst. Die offizielle Anleitung listet über zwanzig Plattformen, darunter Telegram, Slack und WhatsApp (Hermes-Dokumentation).
Schritt drei ist der, an dem Geld verloren geht. Die naheliegende Antwort ist ein API-Schlüssel, und der rechnet jeden einzelnen Aufruf ab. Es gibt aber einen Punkt in der Modellauswahl, der ChatGPT or Codex Subscription heißt. Wählst du den, meldest du dich mit deinem normalen ChatGPT-Konto an und dein vorhandenes Abo bezahlt die Arbeit (Hermes-Dokumentation zu Anbietern).
Ich habe beim ersten Aufbau genau diesen Fehler gemacht und aus Gewohnheit den Schlüssel genommen. Aufgefallen ist es mir erst, als ich den Assistenten eine Woche lang stündlich habe nachsehen lassen, ob neue Anfragen da sind. Die Aufgabe war die richtige, der Zugang war der falsche, und genau das kostet dann Geld für etwas, das im Abo schon drin ist.
🔥 Du willst die Befehle nicht abtippen? Der Jarvis-Bauplan enthält alle fünf Schritte mit den fertigen Befehlen und den Prompts zum Kopieren. → Bauplan holen
Was ein KI Assistent auf eigenem Server im Alltag wirklich tut
Ein Assistent, der nur antwortet, ist ein teureres Chatfenster. Interessant wird er durch drei Dinge, die zusammenkommen.
Das erste ist das Gedächtnis. Er merkt sich, wie dein Geschäft funktioniert, und du hörst auf, jeden Chat mit deiner Vorgeschichte zu beginnen.
Das zweite sind Skills. Erklärst du ihm einmal, wie deine Wochenauswertung entsteht, speichert er den Ablauf und kann ihn beim nächsten Mal ohne Erklärung. Aus einer Aufgabe, die du erklärt hast, wird damit eine Aufgabe, die du nur noch abrufst.
Das dritte ist der Zeitplan. Hermes legt geplante Aufträge in einer eigenen Datei ab und arbeitet sie im Minutentakt ab, ganz ohne dass du etwas anstößt (Hermes-Dokumentation zu Cron). Du kannst den Zeitplan sogar in normalen Worten diktieren, etwa jeden Morgen um sieben eine Zusammenfassung auf Telegram.
Mein Vorschlag für den Anfang ist immer derselbe. Bau eine einzige Sache, die jeden Morgen zuverlässig läuft, und nichts weiter. Wer am ersten Tag zehn Automatiken anlegt, verbringt den zweiten Tag mit Fehlersuche statt mit Arbeit.
Was ein KI Assistent auf eigenem Server im Monat kostet
Die Rechnung hat drei Posten, und zwei davon zahlst du wahrscheinlich schon.
Der erste Posten ist der Server. Eine deutsche Übersicht zum Selbstbetrieb nennt für ein passendes Angebot rund 19 Euro im Monat (innogpt.de), und wer sich beim kleinsten Tarif umsieht, kommt deutlich darunter heraus. Verglichen mit den etwa 150 Euro für einen Server mit Grafikkarte ist das der eigentliche Hebel dieser Bauweise.
Der zweite Posten ist das Modell. Läuft es über dein bestehendes Abo, ändert sich an deiner Rechnung nichts, weil du dieselbe Mitgliedschaft nutzt wie im Browser. Nimmst du stattdessen einen API-Schlüssel, zahlst du jeden einzelnen Aufruf, und ein Assistent, der stündlich nachsieht, ruft sehr oft auf.
Der dritte Posten ist der Agent selbst. Hermes ist quelloffen und kostet nichts.
Unterm Strich landest du bei den Kosten eines kleinen Servers. Das ist weniger als ein Werkzeug-Abo, das du vermutlich gerade zahlst und seltener benutzt.
Drei Fehler beim KI Assistenten auf dem eigenen Server
Der erste Fehler ist der falsche Zugang beim Modell, den ich oben beschrieben habe. Er fällt erst auf der Rechnung auf, und bis dahin läuft er wochenlang mit.
Der zweite Fehler ist der ungesicherte Server. Du gibst einem Programm Zugriff auf eine Maschine, die im Netz steht. Leg dafür einen eigenen Benutzer an, melde dich mit einem Schlüssel statt mit einem Passwort an und lass die Zugangsdaten nicht in einem Chatverlauf landen.
Der dritte Fehler ist der vergessene Neustart. Ein Server wird irgendwann neu gestartet, und wenn dein Agent nicht als Dienst eingerichtet ist, kommt er danach nicht von allein wieder hoch. Bei Hermes erledigt das ein einziger Befehl, den fast jeder beim ersten Aufbau überspringt.
Keiner dieser drei Punkte ist kompliziert. Sie fallen nur alle erst auf, wenn es zu spät ist.
🔥 Nimm den fertigen Bauplan statt der Fehlersuche. Im Jarvis-Bauplan stehen die Stolpersteine an genau der Stelle, an der du sie brauchst. → Guide kostenlos holen
Über Ruwen Bädorf
Ich bin Ruwen Bädorf und ich baue Systeme, die mit KI von allein arbeiten. Ich helfe Selbstständigen, ihre Arbeit einmal zu bauen statt sie jeden Tag zu wiederholen.
- Ich baue und betreibe die komplette Reel-Fabrik auf ki-imperium.com selbst, vom Skript über den Avatar bis zur Auslieferung des Guides.
- Ich arbeite täglich mit Claude, Lovable und Higgsfield und zeige genau die Abläufe, die ich selbst fahre.
- Auf Instagram veröffentliche ich diese Abläufe als Reels, jeweils mit einem Guide zum Nachbauen.
Weiterlesen
Wie derselbe Agent läuft, ohne dass du den Server selbst pflegst, steht in KI Agent 24/7 laufen lassen.
Wenn du wissen willst, wie so ein Agent von innen aufgebaut ist, lies KI Agenten selbst bauen. Wie mehrere Agenten zusammen an einer Aufgabe arbeiten, steht in Claude Code Agenten. Und welche Abläufe sich überhaupt lohnen abzugeben, klärt Prozesse automatisieren für Selbstständige.
Wie ein Modell ganz ohne Internet auf deinem Laptop läuft, zeigt KI offline nutzen.
Ein KI Assistent auf eigenem Server ist am Ende keine Frage von Technik, sondern von einer einzigen Entscheidung: ob deine Arbeit weiterläuft, wenn du den Laptop zuklappst.
Häufige Fragen
Was kostet ein KI Assistent auf eigenem Server?
Du zahlst den Server und deinen KI-Zugang. Eine deutsche Übersicht nennt für ein passendes Angebot rund 19 Euro im Monat, kleinere Tarife liegen darunter. Der Agent selbst ist bei Hermes quelloffen und kostenlos. Läuft das Modell über dein bestehendes ChatGPT-Abo, kommt dafür nichts obendrauf.
Brauche ich eine Grafikkarte für einen KI Assistenten auf eigenem Server?
Nur dann, wenn du auch das Sprachmodell selbst betreiben willst. Läuft nur der Agent bei dir und das Modell in der Cloud, reicht ein einfacher Linux-Server ohne Grafikkarte. Ein Server mit GPU kostet laut einem Anbieter-Vergleich aus 2026 ab etwa 150 Euro im Monat.
Kann ich mein ChatGPT-Abo statt eines API-Schlüssels nutzen?
Ja. In der Modellauswahl von Hermes gibt es den Punkt ChatGPT or Codex Subscription. Du meldest dich per Gerätecode mit deinem normalen OpenAI-Konto an, und die Arbeit läuft über deine Mitgliedschaft statt über eine Abrechnung pro Aufruf.
Welcher Server reicht für Hermes?
Ein kleiner virtueller Server mit Linux, zum Beispiel Ubuntu. Die Installation läuft über einen einzigen Befehl, offiziell unterstützt werden Linux, macOS und WSL2. Wichtig ist nur, dass der Server dauerhaft läuft, denn genau das ist der Grund für den Umzug vom Laptop.
Bleiben meine Daten auf dem eigenen Server?
Nur teilweise. Gedächtnis, Skills und Zeitpläne liegen bei dir. Alles, was das Modell beantworten soll, geht weiterhin an deinen Modellanbieter, genau wie im Chatfenster. Wer echte Datenhoheit braucht, muss das Modell selbst betreiben und dafür einen Server mit Grafikkarte einplanen.
Weiterlesen
Du gibst einmal ein Ziel vor, und ein System arbeitet weiter, bis es erreicht ist. Wie das geht und woran es fast immer scheitert.
Von den eingebauten Subagents bis zum Ruflo-Schwarm: So lässt du in Claude Code mehrere Agenten gleichzeitig für dich arbeiten.
Die meisten sammeln Werkzeuge und haben nach drei Monaten mehr Abos und dieselbe Arbeit. Der Unterschied liegt in einer einzigen Aufgabe.
Hol dir den kostenlosen Guide
Konkrete Schritte, die du sofort in deinem Business anwenden kannst.
Kostenlos. Eintragen dauert zehn Sekunden.