Sicherer Remote-Zugriff für Ihr lokales Apple Silicon LLM: Ein vollständiger Leitfaden
Quick answer
Ersatz für ngrok mit boringproxy für einfache automatische HTTPS: quick comparison answer
Choose the tunnel tool based on the network model: public HTTPS URLs for webhooks and demos, private mesh access for internal apps, and managed infrastructure when policy controls matter most.
Which tunnel tool is best for public webhook testing?
Use a public HTTPS localhost tunnel with stable URLs. InstaTunnel focuses on webhook testing, demos, OAuth callbacks, and MCP endpoint workflows.
When should I choose a private network tool instead?
Choose a private mesh or Zero Trust tool when every user and service should stay inside a controlled private network.
Die Renaissance der lokalen KI-Inferenz hat grundlegend verändert, wie Entwickler Large Language Models (LLMs) erstellen und mit ihnen interagieren. Dank der einheitlichen Speicherarchitektur von Apple Silicon (M1 bis M5) und optimierten Frameworks wie MLX ist das lokale Ausführen von massiven Modellen mit 70B+ Parametern kein Traum mehr, der nur für Serverfarmen reserviert ist. Tools wie Ollama, oMLX und LM Studio verwandeln den Mac Studio oder MacBook Pro auf Ihrem Schreibtisch in einen ernstzunehmenden KI-Server.
Aber was passiert, wenn Sie Ihren Schreibtisch verlassen?
Mit der echten Fähigkeit zur lokalen KI-Inferenz möchten Entwickler natürlich auf die Modelle ihres Heimlabors zugreifen, während sie unterwegs sind, in einem Café arbeiten oder mit einem Remote-Team zusammenarbeiten. Sie wollen die Rechenleistung Ihres M3 Max oder M5 Ultra, haben aber nur ein MacBook Air im Rucksack.
Die unmittelbare Versuchung ist, Ihre Router-Einstellungen zu öffnen und Ihren lokalen Inferenz-Server auf das öffentliche Internet zu portforwarden. Tun Sie das nicht. Das direkte Exponieren der lokalen KI-Infrastruktur im Internet ist ein ernsthaftes Sicherheitsrisiko.
Dieser Leitfaden zeigt die sichersten und robustesten Wege, um von überall auf einen lokalen Ollama-Server zuzugreifen, mit Zero Trust Netzwerktechnologien statt rohem Port-Forwarding: Tailscale, Cloudflare Tunnel und Zrok/ngrok.
1. Der Vorteil von Apple Silicon für lokale KI
Traditionelle PC-Architekturen trennen CPU-Speicher (RAM) vom GPU-Speicher (VRAM). Um ein quantisiertes Llama-Model mit 70B auf einem PC auszuführen, benötigen Sie genügend VRAM, um die Gewichte zu halten. Selbst NVIDIAs aktueller Flaggschiff-Gamer-Grafikkarte, die RTX 5090, erreicht maximal 32GB GDDR7 (ein Sprung von 24GB bei der RTX 4090, aber immer noch eine harte Obergrenze für eine einzelne Karte), weshalb das Ausführen sehr großer Modelle auf PC-Hardware meist mehrere GPUs erfordert.
Apple Silicon nutzt eine Unified Memory Architecture (UMA): CPU und GPU teilen sich einen Pool hochbandbreitenfähigen Speichers, sodass die GPU den Anteil an Speicher adressieren kann, den eine Aufgabe benötigt, anstatt durch eine physisch separate VRAM-Pool beschränkt zu sein. Das ist besonders bei der aktuellen Mac Studio-Reihe sichtbar. Apple hat Mac Studio im August 2026 mit M5 Max und M5 Ultra Chips aktualisiert: Das M5 Max-Modell kommt auf bis zu 128GB einheitlichen Speicher bei 614GB/s Bandbreite, während das M5 Ultra auf einen 36-Kern-CPU, eine 80-Kern-GPU und — die Schlagzeile — bis zu 512GB einheitlichen Speicher bei 1,2TB/s Bandbreite skaliert. Außerdem wurde Thunderbolt 5 in die Reihe aufgenommen, was die Mac-Community bereits nutzt, um mehrere Studios für verteilte Inferenz zu verknüpfen, was die effektive Durchsatzrate bei Modellen, die zu groß für eine Maschine sind, etwa verdreifacht. Beachten Sie, dass 512GB-Konfigurationen bei der Markteinführung des Mac Studio am 22. September 2026 noch nicht verfügbar waren und erst Ende Oktober kamen.
Frameworks, die speziell für diese Hardware entwickelt wurden, vor allem Apples eigenes MLX, sind das, was den Speicher-Vorteil tatsächlich freischaltet. In Kombination mit Ollama — dem beliebten Framework für lokale LLM-Ausführung — ergibt sich ein unternehmensgerechter KI-Server, der still auf Ihrem Schreibtisch steht. Mit Ollama 0.19 (einer Vorschauversion vom 31. März 2026) ist diese Kombination jetzt integriert: Ollama liefert einen nativen MLX-Backend für Apple Silicon, aktiviert mit OLLAMA_USE_MLX=1, und Ollamas eigene Benchmarks auf einem M5 Max zeigen bedeutende Geschwindigkeitssteigerungen beim Pre-Fill und Decode im Vergleich zum vorherigen Metal/llama.cpp-Pfad — Ollama schreibt NVIDIA’s beigesteuerte NVFP4-Quantisierung für einen Teil des Gains zu. Der Haken: Das MLX-Backend erfordert derzeit 32GB oder mehr einheitlichen Speicher, sodass Macs mit 8GB oder 16GB weiterhin auf das bestehende Metal-Backend setzen können, das für sich genommen stabil bleibt. Die Unterstützung weiterer Modellarchitekturen über die initiale Auswahl hinaus wird erwartet, sobald die Funktion aus der Vorschauphase heraus ist. Prüfen Sie vor der Annahme, dass sie aktiv ist, die Release-Notes von Ollama (oder Ihre Server-Logs nach Aktivierung des Flags).
Ein unternehmensgerechter Server benötigt natürlich auch unternehmensgerechte Sicherheit — besonders, wenn Sie ihn remote erreichen wollen.
2. Die Gefahr des Port-Forwardings: Warum Sie einen Reverse Proxy brauchen
Standardmäßig bindet Ollama beim Start auf Ihrem Mac an 127.0.0.1:11434 (localhost). Es ist vollständig unzugänglich für andere Geräte im Netzwerk, geschweige denn für das Internet.
Der veraltete, riskante Weg, um Fernzugriff zu erhalten, ist:
1. Ollama auf 0.0.0.0 (alle Netzwerkschnittstellen) binden.
2. In das Admin-Panel Ihres Heimrouters gehen.
3. TCP-Port 11434 an die interne IP Ihres Macs weiterleiten.
4. Auf Ihr KI-System über die öffentliche IP Ihres Heimnetzwerks zugreifen.
Warum das eine schlechte Idee ist: - Unautorisierter Zugriff. Ollama hat keine integrierte Authentifizierung. Wenn Sie den Port exponieren, kann jeder, der das Internet scannt und Ihre IP findet, Ihre GPU zum Textgenerieren nutzen — oder noch schlimmer, sie für Spam-Generation kapern. - DDoS-Risiko. Ihre Heim-IP wird zum Ziel, sobald bekannt ist, dass sie etwas bereitstellt. - Keine Verschlüsselung. Unverschlüsseltes Port-Forwarding über HTTP bedeutet, dass Prompts und Antworten im Klartext über das Internet übertragen werden. - Ein Einstiegspunkt in Ihr Netzwerk. Jede zukünftige Sicherheitslücke in der exponierten Software wird zum Fuß in Ihrem gesamten Heimnetz.
Die Lösung ist, das Port-Forwarding aufzugeben und stattdessen Zero Trust Tunnels zu verwenden. Ein Zero Trust Tunnel öffnet eine ausgehende Verbindung von Ihrem Mac zu einem sicheren Edge-Netzwerk — keine eingehenden Ports in Ihrer Firewall. Sie erhalten die Routing-Vorteile eines Reverse Proxy, ohne die Sicherheitslücke eines offenen Ports.
3. Voraussetzungen: Ollama für Netzwerkzugriff vorbereiten
Unabhängig von der gewählten Tunneling-Methode muss Ollama Verbindungen außerhalb von localhost akzeptieren.
Unter macOS läuft Ollama als Hintergrunddienst, daher setzen Sie dies vor dem Start der App über eine Umgebungsvariable:
- Terminal öffnen.
- Mit
launchctlOLLAMA_HOSTfür Ihre Benutzersitzung setzen:
launchctl setenv OLLAMA_HOST "0.0.0.0"
- Falls eine Remote-Web-UI die API direkt vom Browser aufruft, auch CORS-Origins setzen:
launchctl setenv OLLAMA_ORIGINS "*"
- Ollama vollständig beenden (über das Menü) und aus den Anwendungen neu starten.
Wenn Sie auch das neuere MLX-Backend für einen spürbaren Geschwindigkeitszuwachs auf Macs mit 32GB+ wollen, fügen Sie hinzu:
launchctl setenv OLLAMA_USE_MLX "1"
und starten Ollama auf gleiche Weise neu. Das ist unabhängig von der Netzwerkkonfiguration — es ist nur ein lokales Inferenz-Geschwindigkeit-Flag.
Ihr lokales LLM ist jetzt bereit, sicher getunnelt zu werden.
4. Methode 1: Tailscale (Die sicherste, nur für Entwickler)
Wenn Sie ein einzelner Entwickler sind, der nur von Ihrem eigenen Laptop oder Smartphone auf Ihre Heim-KI zugreifen möchte, ist Tailscale wahrscheinlich die beste Lösung.
Tailscale ist ein Zero-Config-Mesh-VPN basierend auf WireGuard. Es erstellt ein privates, verschlüsseltes Netzwerk (ein “tailnet”) zwischen Ihren eigenen Geräten, sodass standardmäßig nichts öffentlich im Web sichtbar ist — die sicherste Methode, um remote auf einen Mac-Dienst zuzugreifen.
Tailscale hat im April 2026 seine Preisstruktur überarbeitet: Der kostenlose Personal-Plan deckt jetzt bis zu 6 Nutzer mit unbegrenzten selbst registrierten Geräten pro Nutzer (statt vorher 3 Nutzer, 100 Geräte). Bezahltarife — Standard bei ca. 8 USD/Nutzer/Monat und Premium bei ca. 18 USD/Nutzer/Monat — bieten SSO, MDM-Integration und Tailscale SSH-Session-Logging, aber ein einzelner Entwickler oder kleiner Haushalt kann den kostenlosen Tarif praktisch unbegrenzt nutzen.
Schritt-für-Schritt-Anleitung
- Konto erstellen bei tailscale.com (Google, GitHub oder Microsoft Login).
- Auf dem Host installieren — Ihr Apple Silicon Mac — und anmelden.
- Auf dem Client installieren — Ihr Reise-Laptop, Smartphone oder Tablet.
- Tailscale IP finden. Sobald beide Geräte im tailnet sind, zeigt das Tailscale-Symbol in der Menüleiste Ihres Hosts eine Adresse, die mit
100.x.x.xbeginnt. Sagen wir, es ist100.10.20.30.
Zugriff auf Ihre KI
Von Ihrem entfernten Gerät aus, fragen Sie Ihren Heim-Mac genau so ab, als säßen Sie davor:
curl http://100.10.20.30:11434/api/generate -d '{
"model": "llama3",
"prompt": "Erkläre Quantencomputing in einem Satz."
}'
Vorteile: - Kein öffentliches Internet-Exposé standardmäßig. - End-to-End-Verschlüsselung via WireGuard. - Sehr geringe Latenz. - Der kostenlose Tarif deckt die meisten persönlichen Anwendungsfälle ab.
Nachteile: - Out-of-the-box können nur Geräte im eigenen tailnet auf den Server zugreifen — Sie können keinen Link an einen Nicht-Tailscale-Kollaborateur weitergeben. - Erfordert einen VPN-Client auf jedem verbundenen Gerät.
Der zweite Nachteil hat jetzt eine Lösung: Tailscale Funnel, verfügbar auf allen Plänen (inklusive kostenlos) und derzeit in Beta, ermöglicht es, einen bestimmten lokalen Dienst über eine Tailscale-verwaltete HTTPS-URL öffentlich zugänglich zu machen — ohne dass der Besucher Tailscale laufen muss. Es ist eine engere, gezieltere Form der Exposition als die unten beschriebenen Methoden und eignet sich, wenn Sie nur einen Link an jemanden außerhalb Ihres tailnets weitergeben möchten, ohne einen ganzen Tunnel aufzubauen.
5. Methode 2: Cloudflare Tunnel (Beste für Web-UIs & Team-Sharing)
Wenn Sie Ihre lokale KI über eine normale Webadresse (https://ai.ihredomain.com) erreichen möchten, ohne VPN-Software auf dem Client zu installieren, ist Cloudflare Tunnel die Standardlösung.
Cloudflare Tunnel (über den cloudflared-Daemon) öffnet eine sichere ausgehende Verbindung von Ihrem Mac zu Cloudflares Edge. Mit Cloudflare Access können Sie Nutzer zur Authentifizierung zwingen — via Google, GitHub oder E-Mail-PIN — bevor der Traffic Ihren lokalen Rechner erreicht.
Schritt-für-Schritt-Anleitung
1. Domain & Cloudflare-Konto. Sie benötigen eine Domain, die bei Cloudflare verwaltet wird (ein günstiger .dev oder .io-Domain mit auf Cloudflare gesetzten Nameservern funktioniert gut).
2. Tunnel erstellen. Cloudflare hat im März 2026 die Tunnelverwaltung in das Haupt-Dashboard integriert, unter Networking → Tunnels (der alte Zero Trust-Abschnitt, unter Networks → Connectors, funktioniert noch — beide verwalten die gleichen Tunnel). Das Erstellen eines Tunnels dort liefert standardmäßig einen tokenbasierten, dashboardverwalteten Connector; der alte cloudflared tunnel login-CLI-Flow bleibt als “lokal verwaltete” Alternative bestehen, falls Sie die Anmeldedaten nicht auf Cloudflares Server lagern möchten. Die Navigation im Dashboard ändert sich häufig, suchen Sie bei Unklarheiten nach “tunnels”.
3. cloudflared auf Ihrem Mac installieren via Homebrew:
brew install cloudflared
Dann authentifizieren:
cloudflared tunnel login
4. Den Traffic routen. In der Konfiguration des öffentlichen Hostnamens:
- Subdomain: ai
- Domain: ihredomain.com
- Service-Typ: HTTP
- URL: localhost:11434 (reine Ollama-API) oder localhost:8080 (Open WebUI in Docker)
5. Mit Cloudflare Access absichern. Ohne diesen Schritt kann jeder, der https://ai.ihredomain.com findet, Ihre GPU kostenlos nutzen. Unter Access → Applications fügen Sie eine selbst gehostete Anwendung für ai.ihredomain.com hinzu und erstellen eine Richtlinie (z.B. “Mein E-Mail-Konto erlauben”).
Nach der Einrichtung öffnet der Zugriff auf https://ai.ihredomain.com eine Cloudflare-Login-Abfrage, bevor Sie Ihren Mac überhaupt erreichen.
Ein häufig übersehener Punkt bei der ursprünglichen Einrichtung
Wenn Sie die Domain- und Dashboard-Konfiguration überspringen und nur einen schnellen Tunnel starten —
cloudflared tunnel --url http://localhost:11434
— liefert Cloudflare eine sofortige *.trycloudflare.com-URL ohne Kontoerstellung. Das ist sehr bequem, hat aber zwei harte Limits laut Cloudflares eigener Dokumentation: Quick Tunnels sind auf 200 gleichzeitige Anfragen beschränkt (HTTP 429 bei Überschreitung), und unterstützen kein Server-Sent Events (SSE). Das ist hier wichtig, weil Ollama, Open WebUI und LiteLLM Tokens in Stream-Form zurücksenden, und bei Streaming-Implementierungen kann eine SSE-Antwort bei einem schnellen Tunnel ohne klares Fehlerbild stillhängen oder abbrechen. Namensgebundene Tunnels (die dashboardverwalteten) haben diese Einschränkungen nicht. Betrachten Sie Quick Tunnels daher nur als Demo für wenige Minuten, nicht für dauerhafte Chat-Sitzungen.
6. Methode 3: Zrok & ngrok (Beste für temporäres/kurzes Teilen)
Manchmal brauchen Sie keinen dauerhaften VPN oder eine eigene Domain. Vielleicht sind Sie bei einem Hackathon und möchten, dass ein Teamkollege Ihre lokale LLM-API für eine Stunde nutzt, oder Sie testen einen Webhook.
ngrok ist hier eine sehr brauchbare Option, und es lohnt sich, einen verbreiteten Irrglauben zu korrigieren: Das kostenlose ngrok-Konto setzt keine Session-Timeouts, und jeder kostenlose Account erhält eine permanente, automatisch zugewiesene “Dev-Domain” (z.B. dein-name.ngrok-free.app), die bei Neustarts stabil bleibt — Sie bekommen also nicht bei jedem Start eine neue Zufalls-URL. Das, was das kostenlose Tier begrenzt, sind eher die Limits: bis zu 3 gleichzeitige Endpunkte, 1GB ausgehende Daten pro Monat, 20.000 Requests pro Monat. Für kurzfristiges Teilen reicht das aus, bei längerer Nutzung wird es eng.
Eine neuere, vollständig Open-Source-Alternative auf Basis des OpenZiti-Netzwerks ist zrok. Es wurde kürzlich in Version 2 umbenannt (“zrok2”), was den Binärname und die Konfigurationsordner (zrok2, ~/.zrok2, ZROK2_*) betrifft, und hat das alte Sharing-Modell durch ein Namensraum-basiertes ersetzt.
zrok einrichten
- zrok2 installieren (Homebrew:
brew install zrok2; siehe zrok-Dokumentation für andere Plattformen). - Einladung anfordern:
bash zrok2 inviteDie Anmeldung erfordert kein Token — das Umgebungs-Token für die Aktivierung Ihrer lokalen Installation kommt per E-Mail und wird nach Registrierung im Web-Console eingetragen. 3. Mit dem erhaltenen Token aktivieren:bash zrok2 enable <IHRE_TOKEN> - Ihren lokalen Ollama-Port freigeben:
bash zrok2 share public localhost:11434Wichtig vor dem letzten Befehl: zrok’sshare public-Modus ist standardmäßig offene Berechtigungen — jeder, der den Link hat, kann es nutzen, ohne weitere Zugangskontrolle. Wenn Sie den Zugriff einschränken möchten, fügen Sie--closedund--access-granthinzu. zrok liefert sofort eine HTTPS-URL. Wenn Sie den Prozess beenden, wird der Tunnel dauerhaft geschlossen. — ## 7. Das Erlebnis verbessern: Open WebUI und LiteLLM Das Exponieren der reinen Ollama-API ist gut für Code, aber es fehlt an Komfort eines echten Chat-Interfaces. Zwei zusätzliche Tools runden eine Remote-Setup ab. ### Open WebUI Open WebUI ist ein selbst gehosteter, ChatGPT-ähnlicher Frontend, das auf Apple Silicon in Docker gut läuft. Statt den Port 11434 von Ollama direkt zu tunneln, läuft Open WebUI auf Port 8080 und wird durch Cloudflare oder Tailscale getunnelt. Es bietet eigene Authentifizierung, Nutzerverwaltung und Chat-Historie — eine echte Remote-Arbeitsstation statt nur API. ### LiteLLM Wenn Sie Apps remote bauen und eine OpenAI-kompatible Schnittstelle vor Ollama brauchen, setzen Sie LiteLLM ein. LiteLLM übersetzt OpenAI-API-Aufrufe in Ollama-Aufrufe, generiert eigene API-Schlüssel für Zugriffskontrolle und kann — über die reine Ollama-Nutzung hinaus — mehr als 100 Modellanbieter über eine einheitliche Schnittstelle ansprechen, falls Ihr Setup wächst. Es wird über eineconfig.yamlkonfiguriert und läuft standardmäßig auf Port 4000. Sie können Ihren Tunnel so konfigurieren, dass LiteLLMs Port exponiert wird, den API-Login-Dialog überspringen und stattdessen einen gültigen LiteLLM-API-Schlüssel im Request-Header verlangen — eine echte, selbst gehostete Inferenz-Gateway-Lösung. ### Das Docker-GPU-Falle auf macOS Hier ein häufig übersehener Punkt: Docker Desktop auf macOS kann NVIDIAs GPU nicht in einen Container durchreichen. Wenn Sie Ollama in Docker auf einem Mac laufen lassen, fällt es still auf CPU-only-Inferenz zurück — kein Fehler, nur deutlich schlechtere Leistung, und es ist leicht, das zu übersehen, bis Sie sich fragen, warum Ihr M5 Ultra so langsam ist. Die Lösung ist einfach: Ollama nativ auf macOS laufen lassen (wie oben beschrieben), und nur die Komponenten containerisieren, die keinen direkten GPU-Zugriff benötigen — Open WebUI und LiteLLM kommunizieren über das Netzwerk mit Ollama, also sind sie in Docker kein Problem. Diese Einschränkung besteht seit Apple Silicon, es ist eine Architekturfrage von Docker Desktop, nicht der Hardware. — ## 8. Optimierung Ihres Apple Silicon Hosts für Dauerbetrieb Wenn Sie eine Woche unterwegs sind, wollen Sie nicht, dass Ihr Mac in den Ruhezustand geht und den Tunnel trennt. So bleibt alles aktiv: 1. Systemeinstellungen. Der Pfad hängt vom Gerät ab: Bei Desktop-Macs (Mac Studio, Mac mini) gehen Sie zu Systemeinstellungen → Energie sparen und aktivieren “Automatisches Ruhen bei ausgeschaltetem Bildschirm verhindern” — bei Desktop-Macs gibt es keinen Batterie-Abschnitt. Bei MacBooks ist die entsprechende Option unter Systemeinstellungen → Batterie → Optionen, nur bei Netzbetrieb aktiv. 2. Amphetamine odercaffeinate. Installieren Sie die kostenlose App Amphetamine und setzen Sie eine unbefristete “Keep Awake”-Sitzung, oder laufen Siecaffeinate -iin einem offenen Terminal. 3. Automatischer Start von Diensten. Stellen Sie sicher, dass Ollama, Docker (für Open WebUI) undcloudflaredbeim Systemstart automatisch starten, z.B. vialaunchd, damit ein Stromausfall oder Neustart den Tunnel nicht dauerhaft unterbricht. — ## Schneller Vergleich | | Tailscale | Cloudflare Tunnel | zrok | ngrok | |—|—|—|—|—| | Beste Nutzung | Einzelner/persönlicher Zugriff | Web-UI + Team-Sharing | Kostenlos, temporär, OSS | Schnelles Teilen, vertraute Tools | | Client erforderlich? | Ja (VPN-App), außer bei Funnel | Nein | Nein | Nein | | Öffentliche URL standardmäßig? | Nein (bei Funnel aktivieren) | Ja | Ja (offene Berechtigungen) | Ja (Dev-Domain) | | Kostenfreier Tarif? | 6 Nutzer, unbegrenzte Geräte | Effektiv unbegrenzt (selbst gehosteter Tunnel) | 5GB/Tag, 25 Umgebungen | 3 Endpunkte, 1GB/Monat, 20.000 Requests | | Streaming (SSE) Unterstützung | Ja | Nicht bei Quick Tunnels; ja bei Namens-Tunnels | Ja | Ja | — ## Fazit Apple Silicon hat die KI-Inferenz aus Rechenzentren auf den Schreibtisch geholt — und mit dem Mac Studio-Update im August 2026 mit M5 Max/M5 Ultra und Ollamas neuem MLX-Backend schließt sich die Lücke weiter. Aber echte Infrastruktur bedeutet, Fernzugriff ernst zu nehmen. Vermeiden Sie Port-Forwarding komplett. Nutzen Sie Tailscale, wenn nur Sie Zugriff brauchen und keinen Client installieren möchten (oder greifen Sie zu Funnel, wenn Sie gelegentlich mit jemandem außerhalb Ihres tailnets teilen). Nutzen Sie Cloudflare Tunnel, wenn Sie eine echte Webadresse mit Login für ein kleines Team wollen — lassen Sie Quick Tunnels weg, wenn Streaming von Tokens erforderlich ist. Zrok oder ngrok sind ideal, wenn Sie etwas Temporäres für einen Nachmittag brauchen. Das Modell bleibt lokal. Nur der Zugriff reist. — ## Änderungsprotokoll Faktisch geprüft anhand primärer Quellen (offizielle Dokumentation, Herstellerblogs/Newsrooms und direkte Produktseiten) am 19. September 2026. Korrekturen am Originalentwurf: - Klarstellung, dass Ollama 0.19 (Preview, veröffentlicht am 31. März 2026) jetzt ein natives MLX-Inferenz-Backend für Apple Silicon liefert, aktiviert mitOLLAMA_USE_MLX=1, das 32GB+ einheitlichen Speicher erfordert. Hinzugefügt Ollamas eigene Benchmark-Infos (M5 Max, Qwen3.5-35B-A3B) und NVIDIA-beigesteuerte NVFP4-Quantisierung. - Klärung, dass oMLX eine spezielle,mlx-lm-basierte Inferenz-Server-Implementierung ist, mit kontinuierlichem Batching, zweistufigem (RAM/SSD) KV-Cache und API-Kompatibilität zu OpenAI + Anthropic, nicht nur eine “Wrapper”-Lösung. - Aktualisierung der veralteten Mac Studio-Speicherangaben (“128GB oder 192GB”) auf die aktuellen Werte der August 2026 Generation: bis zu 128GB (M5 Max) / 512GB (M5 Ultra) einheitlichen Speicher, bis zu 1,2TB/s Bandbreite. Hinweis, dass 512GB-Modelle erst ab Ende Oktober 2026 verfügbar waren. - Vergleich der GPU-VRAM-Obergrenze vom RTX 4090 (24GB) auf RTX 5090 (32GB GDDR7), um die Vorteile des einheitlichen Speichers zu unterstreichen. - Korrektur der Tailscale-Free-Tier-Angabe: Jetzt 6 Nutzer im Personal-Plan (April 2026), unbegrenzte Geräte pro Nutzer. Hinzugefügt Tailscale Funnel (Beta, alle Pläne) als Lösung für Nicht-Tailscale-Teilen. - Aktualisierung der Cloudflare-Dashboard-Navigation auf die aktuelle Version: Networking → Tunnels (seit März 2026 im Haupt-Dashboard), mit Networks → Connectors als Alternative. Hinweis, dass Dashboard-gestützte Tunnels jetzt Standard sind, CLI bleibt als Option. - Ergänzung eines Hinweises: Cloudflare Quick Tunnels (cloudflared tunnel --url) sind auf 200 gleichzeitige Requests beschränkt und unterstützen kein SSE, was Streaming-Modelle wie Ollama beeinträchtigen kann. - Korrektur der ngrok-Info: Kostenfreier Account hat seit 2023 eine permanente, stabile “Dev-Domain” (z.B.dein-name.ngrok-free.app), keine Session-Timeouts. Limits: 3 Endpunkte, 1GB/Monat, 20.000 Requests. - Aktualisierung von zrok auf Version 2: Umbenennung, neue Konfigurations- und Umgebungsvariablen, Standard-Share-Modus ist offen (share public), nicht geschlossen. - Neue Sektion zu Docker Desktop auf macOS: Docker kann Apples GPU nicht in Container durchreichen, daher läuft Ollama nativ, nur andere Komponenten in Docker. - Erweiterung der LiteLLM-Beschreibung: Konfiguration viaconfig.yaml, läuft auf Port 4000, kann mehr als 100 Modelle/Provider ansprechen. - Korrektur der “Ruhezustand verhindern”-Einstellung: Bei Desktop-Macs unter Energie sparen (ohne Batterie-Abschnitt), bei Laptops unter Batterie → Optionen. - Neue Tabelle “Schneller Vergleich” für die Methoden. - Entfernung von SEO-ähnlichen Keyword-Formulierungen, stattdessen klare, natürliche Beschreibungen.
Related InstaTunnel pages
Continue from this article into the most relevant product guides and workflows.
Related Topics
Keep building with InstaTunnel
Read the docs for implementation details or compare plans before you ship.