KI-Infrastruktur · Entscheidungs-Guide

Lokale KI oder Cloud KI: Was passt zu Ihrem Anwendungsfall?

Lokale KI und Cloud KI: die Definitionen

Lokale KI (auch On-Premise, Self-Hosted oder On-Device) bedeutet, dass ein KI-Modell auf Infrastruktur läuft, die Sie kontrollieren: ein Server im eigenen Rechenzentrum, eine GPU-Workstation oder ein Edge-Gerät. Genutzt werden dafür meist Open-Weight-Modelle wie Llama, Mistral, Qwen, Gemma oder das Schweizer Modell Apertus, betrieben über Werkzeuge wie Ollama, LM Studio, llama.cpp oder vLLM.

Cloud KI bedeutet, dass Sie ein Modell über die Schnittstelle (API) oder Web-App eines Anbieters nutzen – etwa ChatGPT von OpenAI, Claude von Anthropic oder Gemini von Google. Der Anbieter betreibt Hardware, Modell und Updates; Sie senden Anfragen und bezahlen meist nutzungsbasiert. Beide Ansätze schliessen sich nicht aus: Viele Organisationen kombinieren sie in einer hybriden Architektur.

Der direkte Vergleich: Kontrolle, Kosten, Leistung, Datenschutz

Die vier entscheidenden Dimensionen im direkten Vergleich:

  • Kontrolle & Souveränität – Lokal: Daten und Modell bleiben im Haus, Versionen sind stabil, kein Vendor-Lock-in. Cloud: Der Anbieter kontrolliert Modell, Updates und Verfügbarkeit; Modelle können sich ohne Ihr Zutun ändern.
  • Kosten – Lokal: hohe Anfangsinvestition (CapEx) in Hardware, danach planbare Fixkosten unabhängig vom Volumen. Cloud: keine Vorabkosten, nutzungsbasiert (OpEx), skaliert direkt mit dem Anfragevolumen.
  • Leistung – Cloud: Zugriff auf die stärksten Frontier-Modelle für anspruchsvolles Reasoning und multimodale Aufgaben. Lokal: Open-Weight-Modelle, für viele Aufgaben stark und gut genug, mit Grenzen bei absoluten Spitzenfähigkeiten.
  • Datenschutz – Lokal: kein Datenabfluss an Dritte, ideal für Berufsgeheimnis und hochsensible Daten. Cloud: erfordert Auftragsverarbeitungsvertrag, geprüfte Datenresidenz und klare Regeln zur Trainingsnutzung.
  • Latenz & Offline – Lokal/Edge: niedrige Latenz, funktioniert offline und air-gapped. Cloud: netzabhängig, dafür weltweit verfügbar und ohne eigene Wartung.
  • Skalierung & Wartung – Lokal: durch die eigene Hardware begrenzt, verlangt ein Ops/MLOps-Team. Cloud: elastisch skalierbar, Betrieb und Sicherheit liegen beim Anbieter.

Kosten realistisch: CapEx, OpEx und der Break-even

Bei Cloud KI zahlen Sie pro Nutzung (meist pro Token), es fallen keine Vorabkosten an. Konkrete Preise ändern sich häufig – konsultieren Sie die aktuelle Preisliste des jeweiligen Anbieters. Der Vorteil: Sie starten sofort und die Kosten folgen dem tatsächlichen Bedarf. Der Nachteil: Bei hohem, konstantem Volumen summieren sich die laufenden Kosten schnell.

Bei lokaler KI dominiert die Anfangsinvestition in Hardware. Als grobe technische Orientierung: Ein 7-bis-8-Milliarden-Parameter-Modell in 4-Bit-Quantisierung läuft auf einer Consumer-GPU mit rund 16 GB VRAM; ein 70-Milliarden-Modell benötigt eher 40 GB und mehr, oft mehrere GPUs. Dazu kommen Strom, Kühlung, Ersatzteile und – häufig unterschätzt – Personal für Betrieb, Sicherheit und Modell-Updates.

Die Faustregel: Niedriges oder stark schwankendes Volumen spricht für die Cloud, hohes und konstantes Volumen kann lokal auf Dauer günstiger sein. Rechnen Sie über die gesamte Nutzungsdauer (Total Cost of Ownership) und beziehen Sie versteckte Kosten wie Ausfallsicherheit und Fachpersonal ein.

Datenschutz und Compliance: der Schweizer Blick

In der Schweiz gilt seit September 2023 das revidierte Datenschutzgesetz (revDSG/nFADP), überwacht durch den EDÖB. Für Schweizer Sachverhalte ist nicht die DSGVO massgeblich, sondern das revDSG; die EU-DSGVO greift, wenn Sie Personen in der EU bearbeiten. Zusätzlich wirkt der EU AI Act extraterritorial und kann Schweizer Anbieter treffen, die KI-Systeme in den EU-Markt bringen.

Für besonders schützenswerte Daten und das Berufsgeheimnis (etwa Art. 321 StGB für Ärztinnen, Anwälte, Treuhänder) ist lokale KI oft die klarste Lösung: Die Daten verlassen die eigene Infrastruktur nie. Wollen Sie dennoch Cloud nutzen, achten Sie auf: Datenresidenz in der Schweiz oder EU, einen Auftragsverarbeitungsvertrag, die vertragliche Zusicherung, dass Ihre Daten nicht zum Training verwendet werden, sowie ein sauberes Löschkonzept.

Ein Schweizer Aspekt für die Souveränität: Mit Apertus steht ein an ETH Zürich, EPFL und dem Supercomputing-Zentrum CSCS entwickeltes, offen verfügbares Sprachmodell zur Verfügung, das lokal betrieben werden kann. Solche offenen Modelle stärken die digitale Unabhängigkeit, wenn Datenhoheit oberste Priorität hat.

Leistung und Fähigkeiten: was Modelle heute wirklich leisten

Bei den anspruchsvollsten Aufgaben – komplexes Reasoning, lange Kontexte, fortgeschrittene Multimodalität – führen weiterhin die grossen Frontier-Modelle in der Cloud. Sie werden vom Anbieter laufend verbessert, ohne dass Sie Hardware aufrüsten müssen.

Für viele reale Geschäftsaufgaben sind lokale Open-Weight-Modelle jedoch längst gut genug: Zusammenfassen, Informationen extrahieren, klassifizieren, Entwürfe schreiben oder eine wissensbasierte Suche (RAG) über interne Dokumente. Quantisierung verkleinert Modelle für bescheidenere Hardware – auf Kosten etwas geringerer Genauigkeit. Lokale Modelle lassen sich zudem gezielt auf Ihre Domäne feinjustieren (Fine-Tuning), was Konsistenz und Fachsprache verbessert.

Bei der Latenz gibt es kein pauschales Urteil: On-Device-Modelle antworten ohne Netzwerkweg oft sehr schnell, während grosse Cloud-Rechenzentren enorme Parallelität und Durchsatz bieten. Entscheidend ist Ihr Lastprofil.

Entscheidungs-Guide: wann lokal, wann Cloud, wann hybrid

Nutzen Sie diese Kriterien, um schnell zu einer fundierten Wahl zu kommen:

  • Wählen Sie lokal, wenn: strenge Vertraulichkeit oder Berufsgeheimnis gilt, das Volumen hoch und konstant ist, Sie offline oder air-gapped arbeiten müssen, volle Kontrolle und Anpassbarkeit zählen und Sie ein Ops-Team haben.
  • Wählen Sie Cloud, wenn: Sie die höchste Modellleistung brauchen, das Volumen niedrig oder schwankend ist, ein schneller Start zählt, kein eigenes Betriebsteam vorhanden ist und Sie stets die neuesten multimodalen Funktionen wollen.
  • Wählen Sie hybrid, wenn: verschiedene Aufgaben verschiedene Antworten verlangen. Ein bewährtes Muster: sensible Daten und Standardaufgaben lokal verarbeiten, besonders schwierige Anfragen an die Cloud weiterreichen, und personenbezogene Angaben vor jedem Cloud-Aufruf lokal anonymisieren oder maskieren.
  • Prüfen Sie unabhängig vom Modell immer: Wo liegen die Daten, wer haftet, wie sieht der Ausstieg (Exit) aus und wie vermeiden Sie Lock-in? Standardisierte Schnittstellen und Open-Weight-Optionen halten Ihnen die Tür offen.

Häufige Fragen

Was ist der Hauptunterschied zwischen lokaler KI und Cloud KI?

Lokale KI läuft auf Hardware, die Sie kontrollieren, sodass Daten das Haus nicht verlassen; Cloud KI läuft beim Anbieter und wird über eine Schnittstelle genutzt. Lokal bedeutet mehr Kontrolle und Fixkosten, Cloud mehr Leistung und Flexibilität bei laufenden Kosten.

Ist lokale KI immer günstiger als Cloud KI?

Nein. Lokal verlangt hohe Anfangsinvestitionen und laufenden Betrieb; das lohnt sich vor allem bei hohem, konstantem Volumen. Bei niedrigem oder schwankendem Bedarf ist die nutzungsbasierte Cloud meist günstiger. Rechnen Sie immer über die gesamte Nutzungsdauer inklusive Personal und Ausfallsicherheit.

Welche Option ist für Datenschutz und Berufsgeheimnis besser?

Für sehr sensible Daten und Berufsgeheimnis (z. B. Medizin, Recht, Treuhand) ist lokale KI oft die klarste Wahl, weil Daten die eigene Infrastruktur nie verlassen. Cloud kann konform sein, verlangt aber Datenresidenz in der Schweiz oder EU, einen Auftragsverarbeitungsvertrag und die Zusicherung, dass Daten nicht zum Training genutzt werden – im Einklang mit dem revDSG.

Sind lokale Open-Weight-Modelle so leistungsfähig wie Cloud-Modelle?

Bei den schwierigsten Aufgaben führen weiterhin grosse Frontier-Modelle in der Cloud. Für viele Standardaufgaben – Zusammenfassen, Extrahieren, Klassifizieren, Entwürfe, RAG – sind lokale Open-Weight-Modelle jedoch gut genug und lassen sich gezielt feinjustieren. Prüfen Sie die Eignung immer an Ihren konkreten Aufgaben, nicht an allgemeinen Ranglisten.

Was ist ein hybrider Ansatz und wann ergibt er Sinn?

Hybrid kombiniert beide Welten: Sensible Daten und Standardaufgaben werden lokal verarbeitet, besonders schwierige Anfragen an die Cloud weitergereicht. Häufig werden personenbezogene Angaben vor dem Cloud-Aufruf lokal anonymisiert. Das lohnt sich, wenn Datenschutz und Spitzenleistung gleichzeitig gefragt sind.

Wie vermeide ich Vendor-Lock-in bei der KI-Wahl?

Setzen Sie auf standardisierte, austauschbare Schnittstellen, halten Sie Prompts und Daten portabel und behalten Sie eine Open-Weight-Option als Alternative. Klären Sie vorab Datenexport, Löschung und Ausstiegsbedingungen. Offene Modelle wie das Schweizer Apertus stärken zusätzlich die Unabhängigkeit.

Begriffe im Glossar

← Zurück zur Übersicht

Praktische KI für Ihr Unternehmen

Von der Idee zur Umsetzung – wir zeigen Ihnen, was in Ihrem Fall konkret möglich ist.

Demo anfordern