Lokale AI-modellen op eigen hardware: wanneer wel en wanneer niet
Open-weight modellen, Ollama en LM Studio, de hardware die je nodig hebt en de Europese middenweg.
"Kunnen we AI niet gewoon op onze eigen computer draaien? Dan gaat er niks naar Amerika." Die vraag krijgen we in bijna elke sessie. Het antwoord is ja, dat kan, en het is in 2026 makkelijker dan ooit. Maar voor de meeste bedrijven is het niet de beste keuze. Lokale modellen zijn sterk bij privacy, offline werken en heel veel simpel werk. Ze verliezen op kwaliteit en op onderhoud. En er zit een middenweg tussen die vaak vergeten wordt: Europese cloud.
Wat zijn open-weight modellen?
Bij ChatGPT, Claude en Gemini gebruik je een model dat op de servers van de aanbieder draait. Bij een open-weight model kun je de "gewichten" (het getrainde model zelf) downloaden en op je eigen hardware draaien. Dat is niet hetzelfde als open source in de strikte zin: de trainingsdata en -code zijn meestal niet openbaar, en de licentie kan beperkingen hebben.
De belangrijkste families in september 2026:
| Familie | Van | Recente versie | Licentie en aandachtspunten |
|---|---|---|---|
| gpt-oss | OpenAI (VS) | gpt-oss-20b en -120b, augustus 2025 | Apache 2.0. De 120b (117 mld parameters, 5,1 mld actief) past op één 80 GB-GPU; de 20b is bedoeld voor lokaal gebruik. |
| Llama | Meta (VS) | Llama 4 Scout en Maverick, april 2025 | Eigen licentie. De multimodale rechten (beeld) gelden niet voor mensen en bedrijven gevestigd in de EU. Meta stapte in april 2026 voor zijn eigen chatbots over op het nieuwe Muse Spark. |
| Mistral | Mistral AI (Frankrijk) | Mistral Large 3 en Ministral 3 (december 2025), Mistral Small 4 (maart 2026) | Apache 2.0 voor deze modellen. Europees bedrijf. |
| Qwen | Alibaba (China) | Qwen3 (april 2025), 3.5 en 3.6 (2026) | Grotendeels Apache 2.0, van 0,6 mld tot honderden miljarden parameters. |
| Gemma | Google (VS) | Gemma 4, 2 april 2026 | Nu Apache 2.0. Van E2B (telefoon) tot 31B; contextvenster tot 256.000 tokens. |
| DeepSeek | DeepSeek (China) | V4 Flash en Pro, 2026 | MIT-licentie. V4 Pro heeft 1,6 biljoen parameters: niet voor je bureau bedoeld. |
Een belangrijk onderscheid bij DeepSeek: de app stuurt je gegevens naar China. De Nederlandse overheid verbood ambtenaren in februari 2025 om die app te gebruiken, de Autoriteit Persoonsgegevens startte een onderzoek, en in Italië en Duitsland grepen toezichthouders in. De open gewichten op je eigen machine draaien is iets anders: dan gaat er niets naar DeepSeek. Wel blijft de vraag hoe het model zelf met gevoelige onderwerpen omgaat.
Wat je nodig hebt
Software: Ollama of LM Studio
Je hoeft geen ontwikkelaar te zijn. De twee populairste programma's:
- Ollama: installeren, één commando, en het model draait. Volgens de documentatie ziet Ollama je prompts en data niet als je lokaal werkt. Let op: Ollama heeft inmiddels ook cloudmodellen; die kun je uitzetten. En het standaard contextvenster is klein (4.096 tokens), dus voor lange documenten moet je dat ophogen.
- LM Studio: een app met een chatvenster, handig als je niet van de terminal houdt. Sinds 8 juli 2025 ook gratis voor zakelijk gebruik; voorheen had je daarvoor een aparte licentie nodig.
Beide bieden een lokale API die op die van OpenAI lijkt, zodat je bestaande tools en automatiseringen er vaak aan kunt koppelen.
Hardware: geheugen is alles
De vuistregel: het model moet in het geheugen van je videokaart passen, of bij een Mac in het gedeelde werkgeheugen. En de snelheid wordt vooral bepaald door de geheugenbandbreedte.
- Mac: door het gedeelde geheugen populair voor lokale AI. De huidige Mac Studio met M5 Max start op 36 GB met 460 GB/s bandbreedte; de M5 Ultra start op 96 GB met 1,2 TB/s.
- NVIDIA RTX 5090: 32 GB videogeheugen, 575 watt. Door geheugentekorten waren de prijzen in 2026 flink hoger dan de adviesprijs.
- NVIDIA DGX Spark: een kastje met 128 GB. Kwam in oktober 2025 uit voor 3.999 dollar en ging in februari 2026 naar 4.699 dollar. Een review van IntuitionLabs mat bij gpt-oss-120b ongeveer 39 tokens per seconde bij het genereren: bruikbaar, maar merkbaar trager dan de cloud.
Wanneer lokaal zinnig is
- Privacy die niet onderhandelbaar is. Medische dossiers, juridische stukken, HR-gesprekken, broncode van een klant die in het contract heeft staan dat niets de deur uit mag. Lokaal betekent: geen verwerker, geen doorgifte buiten de EU, geen verwerkersovereenkomst nodig voor dit stuk.
- Offline werken. Op locatie, in een werkplaats zonder goede verbinding, in het vliegtuig. Kleine modellen als Gemma 4 E2B draaien zelfs op een telefoon.
- Groot volume, simpele taak. Duizenden documenten per dag classificeren, facturen uitlezen, e-mails labelen. Een klein model dat dit goed genoeg doet, draait dag en nacht zonder tokenrekening.
- Experimenteren zonder zorgen. Een model uitproberen op echte bedrijfsdata voordat je beslist welke dienst je afneemt.
Wanneer niet
Kwaliteit
De beste open modellen zitten dicht achter de top, maar niet erop. Onderzoeksinstituut Epoch AI mat dat de sterkste open-weight modellen sinds januari 2026 gemiddeld vier maanden achterlopen op de beste gesloten modellen. En dan heb je het over enorme modellen als GLM-5 en Kimi K2.5, niet over wat op je bureau past. Modellen die op één consumentenkaart als de RTX 5090 draaien, halen volgens Epoch het niveau van topmodellen van zes tot twaalf maanden eerder, met de kanttekening dat kleine modellen vaak op benchmarks zijn geoptimaliseerd. In de praktijk merk je het bij lastige redeneringen, lange documenten, Nederlands op hoog niveau en bij werken met tools.
Onderhoud
Een lokaal model is een systeem dat iemand moet beheren. Updates, nieuwe modelversies testen, beveiliging van de machine, back-ups, en de vraag wie het oppakt als het op vrijdagmiddag niet werkt. Bij een klein team is dat vaak de doorslag. Daar komt bij dat de markt hard beweegt: Meta zette na Llama 4 een eigen, nieuw model in voor zijn chatbots. Wie op één familie bouwt, moet af en toe verhuizen.
De middenweg: Europese cloud en dataresidentie
Vaak is de echte vraag niet "lokaal of cloud", maar "blijft mijn data in Europa?". Daar zijn in 2025 en 2026 goede antwoorden op gekomen:
- Mistral: Frans bedrijf; Le Chat verwerkt standaard in datacenters in Frankrijk. Mistral bouwt een eigen datacenter bij Parijs (in maart 2026 financierde het daarvoor 830 miljoen dollar aan schuld). De API-prijs van Mistral Large is 0,50 dollar per miljoen inputtokens en 1,50 dollar per miljoen outputtokens; Le Chat Team kost 24,99 dollar per gebruiker per maand.
- Microsoft Azure: Microsoft rondde op 26 februari 2025 zijn EU Data Boundary af: klantdata voor Microsoft 365, Dynamics, Power Platform en de meeste Azure-diensten wordt in de EU en EFTA opgeslagen en verwerkt. Azure OpenAI heeft een aparte EU-datazone.
- AWS: sinds 15 januari 2026 is er de AWS European Sovereign Cloud, met een eerste regio in Brandenburg (Duitsland), beheerd door EU-ingezetenen, en geplande lokale zones in onder meer Nederland.
- Google Cloud: Vertex AI kan data opslaan in onder meer Nederland, België en Duitsland, en heeft een EU-endpoint dat de verwerking binnen de EU houdt. Let op: Google legt dat per model vast, en het 'global' endpoint geeft geen enkele garantie.
- OpenAI: biedt sinds februari 2025 dataresidentie in Europa voor ChatGPT Enterprise, Edu en de API.
Eén kanttekening die eerlijk is om te noemen: bij Amerikaanse aanbieders blijft de discussie over de Amerikaanse CLOUD Act. Critici wijzen erop dat een Amerikaans moederbedrijf onder Amerikaans recht valt, waar de servers ook staan. Voor de meeste mkb-toepassingen is EU-dataresidentie met een goede verwerkersovereenkomst voldoende; voor defensie, overheid of zeer gevoelige data kan dat anders liggen. Meer over wat je wel en niet mag invoeren lees je in AI en de AVG.
De kosten: hardware tegenover API
Een eerlijke rekensom. Neem een DGX Spark van 4.699 dollar. Voor dat bedrag koop je bij Mistral ongeveer 9,4 miljard inputtokens of 3,1 miljard outputtokens van Mistral Large. Ter vergelijking: een offerte van twee A4'tjes is een paar duizend tokens. Een klein bedrijf komt in jaren niet aan dat volume.
| Lokaal (eigen hardware) | API / abonnement | |
|---|---|---|
| Aanschaf | Eenmalig, duizenden euro's voor serieuze modellen | Geen |
| Per gebruik | Stroom, verder niets | Per token of per gebruiker per maand |
| Kwaliteit | Maanden tot een jaar achter de top | Nieuwste modellen |
| Beheer | Zelf (of iemand die je inhuurt) | Bij de aanbieder |
| Data | Blijft bij jou | Bij de aanbieder, eventueel in de EU |
Lokaal wordt pas financieel interessant bij hoog, voorspelbaar volume, of als de hardware er toch al staat. Wil je weten wat de cloud voor jouw gebruik kost, zie Wat kost AI echt?

Wat betekent dit voor jouw bedrijf
- Begin met de datavraag, niet met de hardware. Maak een lijstje: welke gegevens mogen naar een cloud-AI, welke alleen naar de EU, welke nergens heen? Vaak blijkt dat maar een klein deel echt lokaal moet.
- Probeer het een middag. Installeer LM Studio of Ollama op een Mac of pc met 16 GB of meer, laad gpt-oss-20b of een Gemma 4-model en test je eigen taken. Dan weet je of het goed genoeg is.
- Combineer. Gevoelige stukken lokaal samenvatten of anonimiseren, en het zware denkwerk met een zakelijk cloudmodel. Dat is vaak het beste van beide.
- Kies bewust een EU-optie als klanten of contracten dat vragen: Mistral, of de EU-regio van de cloud die je al gebruikt.
- Check de licentie. Apache 2.0 en MIT zijn ruim. Bij Llama 4 gelden beperkingen voor EU-bedrijven bij het multimodale deel.
- Reken onderhoud mee. Wie beheert het, en hoeveel uur per maand kost dat?
Conclusie
Lokale AI is volwassen: gratis software, goede open modellen onder ruime licenties en hardware die op een bureau past. Voor privacygevoelig werk, offline gebruik en grote hoeveelheden simpel werk is het een serieuze optie. Voor het meeste kenniswerk in een klein bedrijf wint de cloud nog op kwaliteit en gemak, en met Europese dataresidentie is de privacyzorg vaak al grotendeels weg te nemen. Het slimste antwoord is meestal niet of-of, maar per taak kiezen.
Veelgestelde vragen
Kan ik ChatGPT lokaal draaien?
Welke software heb ik nodig om een AI-model lokaal te draaien?
Is DeepSeek lokaal draaien veilig?
Zijn lokale modellen net zo goed als ChatGPT of Claude?
Wat is een goed alternatief als mijn data in Europa moet blijven?
Bronnen
- openai/gpt-oss-120b — Hugging Face / OpenAI,
- Llama (language model) — Wikipedia,
- European Union excluded from Llama 4 multimodal models — IO+,
- Qwen — Wikipedia,
- Gemma 4: Byte for byte, the most capable open models — Google,
- Models overview — Mistral AI,
- deepseek-ai/DeepSeek-V4-Pro — Hugging Face / DeepSeek,
- Dutch gov't bans officials from using Chinese AI app DeepSeek over espionage concerns — NL Times,
- Germany tells Apple, Google to block DeepSeek — CNBC,
- LM Studio is free for use at work — LM Studio,
- FAQ — Ollama,
- Mac Studio – Technische gegevens — Apple,
- GeForce RTX 5090 — NVIDIA,
- NVIDIA DGX Spark Review — IntuitionLabs,
- Open models lag state-of-the-art closed models by 4 months — Epoch AI,
- Frontier AI performance becomes accessible on consumer hardware — Epoch AI,
- Pricing — Mistral AI,
- Mistral AI raises $830M in debt to set up a data center near Paris — TechCrunch,
- Microsoft completes landmark EU Data Boundary — Microsoft,
- AWS launches AWS European Sovereign Cloud and announces expansion across Europe — Amazon,
- AWS Launches European Sovereign Cloud amid Questions about U.S. Legal Jurisdiction — InfoQ,
- Vertex AI data residency: GDPR rules and EU alternatives — Optinest,
- OpenAI expands data residency for enterprise customers — Computerworld,
Geschreven door
Co-founder Webnexus
Boyd zit al ruim tien jaar in online marketing en runt Webnexus sinds 2015 samen met Peter Dragstra. Tegenwoordig vooral met AI en automatisering bezig: niet in theorie, maar in de Cut The Crap-sessies en in ons eigen bedrijf. Wat hij schrijft heeft hij zelf gebouwd, getest of weggegooid.
Gereviewd door Peter Dragstra, Co-founder Webnexus ·
Wil je weten wat dit voor jouw bedrijf betekent?
In één ochtend lichten we je bedrijf door: marketing, processen, tools, kosten en AI-kansen. Binnen een week heb je een rapport met concrete besparingen en een plan voor twaalf maanden. Verdien je geen €2.000 terug? Dan betaal je niks.
3 uur op locatie · €1.500 · terugverdiengarantie