Zum Inhalt springen
myvpsguide

Proxmox-HA: wann sie hilft und wann sie schadet

Wie HA in Proxmox funktioniert, warum Quorum und Watchdog zusammengehören und in welchen Fällen HA mehr Ausfälle erzeugt, als sie verhindert.

veröffentlicht 19.08.2026
4 min lesezeit
profi

Hochverfügbarkeit in Proxmox macht ein Versprechen: Fällt ein Knoten aus, starten seine Gäste woanders. Das funktioniert, wenn drei Voraussetzungen stimmen. Fehlt eine davon, erzeugt HA genau das, was sie verhindern sollte: Neustarts zur Unzeit.

Wie es funktioniert#

Drei Bausteine greifen ineinander:

  1. Quorum. Der Cluster entscheidet per Mehrheit, wer noch dazugehört. Ohne Mehrheit darf ein Knoten nichts starten.
  2. Watchdog. Ein Zeitgeber, der den Knoten hart neu startet, wenn er die Mehrheit verliert. Das klingt brutal und ist der Kern der Sache: Es garantiert, dass ein abgehängter Knoten seine Gäste wirklich nicht mehr betreibt, bevor sie woanders starten.
  3. Gemeinsamer Zugriff auf die Daten. Ein anderer Knoten kann eine VM nur starten, wenn er ihre Platte sieht.
Warum der Watchdog neu startet, statt zu warten

Zwei Knoten, die sich nicht mehr sehen, halten sich beide für den überlebenden. Würden beide dieselbe VM starten, schrieben zwei Systeme gleichzeitig auf dieselbe Platte, das zerstört das Dateisystem zuverlässiger als jeder Hardwaredefekt. Der Watchdog schließt das aus, indem er den Knoten ohne Mehrheit abschießt. Wer HA einschaltet, akzeptiert diesen harten Neustart als Preis.

Voraussetzung 1: drei Stimmen#

Zwei Knoten können keine Mehrheit bilden, bei einer Trennung hat jeder genau eine von zwei Stimmen. Die Lösungen:

# Variante A: ein dritter Knoten
pvecm status

# Variante B: zwei Knoten plus Zeuge (QDevice) auf einer kleinen dritten Maschine
apt install corosync-qdevice          # auf beiden Knoten
apt install corosync-qnetd            # auf dem Zeugen
pvecm qdevice setup <ip-des-zeugen>
pvecm status                          # "Qdevice" muss auftauchen

Der Zeuge darf ein kleiner Container oder ein Raspberry Pi sein, er rechnet nichts, er stimmt nur ab. Wichtig ist nur, dass er nicht am selben Strom und nicht am selben Schalter hängt wie einer der beiden Knoten.

Voraussetzung 2: das Corosync-Netz#

Corosync trägt die Abstimmung und reagiert empfindlich auf Verzögerung. Wenn die Cluster-Kommunikation über dasselbe Netz läuft wie ein Backup-Lauf, kann eine nächtliche Sicherung eine Mehrheitsentscheidung auslösen, mit Watchdog-Neustart als Folge.

Deshalb: eigenes Netz für Corosync, möglichst mit zweitem Ring. Wie das eingerichtet wird und was ein zweiter Ring bringt, steht in Proxmox-Cluster aufbauen.

corosync-cfgtool -s        # Ringe und deren Zustand
journalctl -u corosync -n 50

Voraussetzung 3: die Daten#

StorageHA möglichFolge
Cephjajeder Knoten sieht alles, kein Datenverlust beim Umzug
NFS/iSCSIjaeinfacher als Ceph, das Gerät ist der neue Einzelpunkt
ZFS mit Replikationja, mit EinschränkungUmzug verliert alles seit der letzten Replikation
LVM-Thin lokalneinkeine andere Maschine kann die Platte lesen

Die dritte Zeile ist die praktisch interessanteste für kleine Aufbauten: Replikation alle 15 Minuten kostet wenig und erlaubt Failover, mit bis zu 15 Minuten Datenverlust. Für einen Spielserver hinnehmbar, für eine Bestellabwicklung nicht. Die Auswahl der Storage-Ebene steht in Proxmox-Storage: welcher Typ wofür.

Einrichten#

# Gast unter HA-Verwaltung stellen
ha-manager add vm:110 --state started --max_restart 3 --max_relocate 2

# Wo darf er laufen, mit welcher Vorliebe?
ha-manager groupadd bevorzugt-pve1 --nodes "pve1:2,pve2:1"
ha-manager set vm:110 --group bevorzugt-pve1

ha-manager status

Die Zahlen hinter den Knotennamen sind Prioritäten: Der Gast läuft bevorzugt auf pve1 und wandert zurück, sobald der wieder da ist. Ob das erwünscht ist, ist eine Entscheidung, ein automatisches Zurückwandern bedeutet einen zweiten Neustart.

Testen, bevor es zählt#

Ein HA-Aufbau, der nie geprüft wurde, ist eine Vermutung.

# Ehrlichster Test: Netzwerkkabel des Knotens ziehen (oder Port abschalten)
# Auf einem anderen Knoten dabei zusehen:
watch -n1 'ha-manager status; pvecm status | grep -A3 Quorum'

Was du sehen willst: Der abgehängte Knoten startet nach etwa einer Minute selbst neu, die Gäste kommen auf einem anderen Knoten hoch. Was du dabei mitmisst: Wie lange dauert es wirklich? Diese Zahl ist die Zusage, die du geben kannst, nicht „hochverfügbar“.

Wann HA schadet#

  • Bei wackeligem Netz. Jede kurze Störung wird zum Neustart. Ohne stabiles Cluster-Netz ist ein einzelner, gut gesicherter Knoten verfügbarer.
  • Bei zwei Knoten ohne Zeugen. Dann steht bei jeder Trennung alles.
  • Bei Diensten, die den Neustart nicht mögen. Eine Datenbank ohne saubere Wiederherstellung nach hartem Ausfall wird durch HA nicht sicherer.
  • Wenn Hardware durchgereicht ist. Ein Gast mit durchgereichtem USB-Gerät oder GPU kann auf dem anderen Knoten nicht starten, siehe Home Assistant auf Proxmox.
  • Als Ersatz für Backups. HA schützt gegen Hardwareausfall, gegen nichts anderes. Ein gelöschter Datensatz wird zuverlässig hochverfügbar gelöscht (PBS).

Häufige Fragen#

Wie lange dauert ein Failover?#

In der Größenordnung von ein bis zwei Minuten, bis die VM auf dem anderen Knoten startet, plus deren eigene Startzeit. Miss es selbst, siehe oben.

Braucht HA Ceph?#

Nein, aber gemeinsamen oder replizierten Storage. Ceph ist die Antwort ab drei Knoten mit eigenem Netz; NFS ist die einfachere Antwort mit einem zusätzlichen Einzelpunkt.

Was macht der Watchdog, wenn ich alles richtig gemacht habe?#

Nichts. Er ist der Notausgang für den Fall, dass ein Knoten die Mehrheit verliert. Im Normalbetrieb sieht man ihn nie.

Kann ich HA für einzelne Gäste einschalten?#

Ja, und das ist der empfohlene Weg: nur die Dienste, die es wirklich brauchen. Alles andere kostet Komplexität ohne Gegenwert.

Reicht Replikation ohne HA?#

Für viele kleine Aufbauten ja: Bei einem Ausfall startest du die Gäste von Hand auf dem zweiten Knoten. Das dauert Minuten statt Sekunden und es passiert nie versehentlich.

Kurz gesagt#

  • HA braucht drei Stimmen, ein ruhiges Corosync-Netz und erreichbare Daten.
  • Der Watchdog startet hart neu, das ist Absicht, kein Fehler.
  • ZFS-Replikation macht HA möglich, mit Datenverlust bis zur letzten Replikation.
  • Einmal echt testen und die Ausfallzeit messen; erst dann ist es eine Zusage.
  • HA ersetzt kein Backup und hilft nicht bei durchgereichter Hardware.
MRMedia

Geschrieben aus dem laufenden Betrieb: MRMedia betreibt eigene Proxmox- Hosts, einen Backup-Server und Kundendienste in der EU. Fehler in einer Anleitung sind Fehler im eigenen Betrieb. Korrekturen bitte über Discord.