AI op je eigen server: een groot model draait nu op een gewone pc
Een open-source inferentie-engine draait een model van 125 miljard parameters op een enkele gaming-videokaart van 12 GB. Wat dat verandert aan de afweging om AI op je eigen server te zetten, en wat je eerst nakijkt.
Waarom AI op je eigen server tot nu toe afketste op de hardware
Bij veel ondernemers komt dit gesprek vroeg of laat langs. Je wil AI inzetten op gegevens die je liever niet naar een Amerikaanse clouddienst stuurt: personeelsdossiers, medische intakes, contracten, de administratie van een klant die daar in zijn eigen voorwaarden eisen aan stelt. De vraag is dan niet of AI het werk kan, maar of je het bij jezelf kunt laten draaien.
Het antwoord was tot nu toe bijna altijd: technisch ja, financieel nee. De modellen die goed genoeg zijn voor echt werk vragen zoveel videogeheugen dat je uitkomt op serverkaarten van tienduizenden euro's, of op een gehuurde GPU-server die per maand meer kost dan het abonnement dat je wilde vermijden. Daarmee viel de optie in de praktijk af voor elk bedrijf zonder eigen serverruimte.
Wat er deze week is veranderd
Een open-source project genaamd Strata liet zien dat die rekensom kan kantelen. Strata is een inferentie-engine, het stukje software dat een taalmodel daadwerkelijk laat rekenen op jouw hardware. Het project meldt dat het een model van 125 miljard parameters draait op een enkele consumentenvideokaart met 12 GB geheugen, met 32 GB gewoon werkgeheugen ernaast. Dat is het formaat van een stevige gaming-pc, niet van een datacenterkast.
De truc zit in hoe het model is opgebouwd. Het gebruikte model bestaat niet uit één groot geheel, maar uit een enorme verzameling kleine specialisten, en per woord zijn er maar een handvol van nodig. Strata houdt de specialisten die vaak aan de beurt komen op de videokaart en parkeert de rest in het gewone werkgeheugen. Zo hoeft niet het hele model in dat dure videogeheugen te passen.
De snelheden die het project zelf rapporteert op een NVIDIA RTX 5070 liggen rond 94 tokens per seconde aan uitvoer en 2.650 tokens per seconde aan invoer. Op een AMD RX 9070 XT is dat 60 en 1.160. Dat is geen laboratoriumsnelheid: 94 tokens per seconde leest ongeveer net zo snel als je zelf kunt meelezen. Het project staat onder een MIT-licentie, installeert met een enkel script op Windows en Linux, en biedt op je eigen machine een koppeling aan die zich gedraagt als de bekende cloud-API's.
Waar je wel scherp op moet zijn
Dat laatste punt is belangrijker dan het klinkt, en het is ook waar het eerlijke verhaal begint. Om het model in dat kleine geheugen te krijgen wordt het sterk gecomprimeerd. Die compressie is niet gratis: hoe verder je gaat, hoe meer het model aan precisie inlevert. Op een samenvatting of een eerste concept merk je dat nauwelijks, op het nauwkeurig overnemen van bedragen, datums en namen uit een document wel.
Daarbij is dit jonge software. Het versienummer begint met een nul, en dat is geen formaliteit: er zitten nog scherpe randen in. Dit is gereedschap om mee te experimenteren op een machine die niets kritisch doet, niet iets wat je maandag onder je klantcontact schuift.
En een eigen server betekent dat het onderhoud ook van jou is. Updates, back-ups, beveiliging en de vraag wie er iets van weet als jij op vakantie bent: dat hoort er allemaal bij. We schreven eerder uitgebreider over wanneer AI op je eigen server een slimme keuze is, en die afweging verandert hier niet door. Wat verandert, is dat de hardwarekosten geen automatische showstopper meer zijn.
Voor welk werk dit nu interessant wordt
Dit is geen vervanging van de modellen die je in de cloud gebruikt voor je zwaarste werk. Het is wel een serieuze optie geworden voor een categorie klussen die veel bedrijven nu niet durven te automatiseren omdat de gegevens de deur niet uit mogen:
- Documenten doorzoeken en samenvatten die onder een geheimhoudingsplicht vallen
- Inkomende post of mail een eerste indeling geven voordat een mens ernaar kijkt
- Een interne vraagbaak op je eigen handboeken, procedures en contracten
- Grote hoeveelheden vrije tekst opschonen of herschrijven, zoals verouderde productteksten
- Werk dat 's nachts mag doorlopen, waar snelheid per antwoord niet uitmaakt
Dat laatste punt is de onderschatte winst. Op je eigen machine betaal je niet per woord. Een klus die in de cloud te duur is om op alle 40.000 regels van je oude productdatabase los te laten, kan op eigen hardware gewoon een weekend draaien.
Hoe je het uitprobeert zonder er iets aan te hangen
De verstandige route is klein en apart. Zet het op een losse machine, of op een pc die toch al in de hoek staat, en geef hem één concrete taak waarvan je het goede antwoord al kent. Bijvoorbeeld: "Vat deze twintig klantmails samen in één regel per mail en noem per mail welke afdeling eigenaar is." Die twintig mails heb je zelf ook gelezen, dus je kunt nakijken of het klopt.
Daarna vergelijk je hetzelfde lijstje met het model dat je nu in de cloud gebruikt. Dat is de enige meting die iets zegt. Wil je die vergelijking maken zonder zelf hardware neer te zetten, dan kun je ook een goedkoper model onder je bestaande tool hangen en de rekening naast elkaar leggen. Niet "kan het dit", maar "haalt het dit goed genoeg voor dit werk, en scheelt het genoeg om het onderhoud waard te zijn".
Werkt dat, dan hang je het pas in een keten. Een eigen model past hier prima in: omdat het zich voordoet als een normale cloud-API, kun je het in een automatiseringsplatform als n8n op dezelfde plek inpluggen waar nu een cloudmodel zit, en in één stap terugschakelen als het resultaat niet bevalt.
Wat je nu eigenlijk beslist
De vraag is dus verschoven. Hij was: kunnen we ons de hardware veroorloven om AI op onze eigen server te zetten? Hij is nu: hebben we werk waarbij het de moeite is om het onderhoud zelf te doen in ruil voor gegevens die het gebouw niet verlaten?
Voor de meeste bedrijven is het antwoord daarop niet "alles zelf" en niet "alles in de cloud", maar een splitsing. Gevoelig werk op eigen hardware, de rest in de cloud waar de kwaliteit hoger ligt en het onderhoud niet van jou is. Dat is een bewuste keuze per proces, en die kun je nu voor het eerst maken zonder dat de hardwareprijs hem voor je maakt.
Benieuwd of jouw gevoelige werk hiervoor in aanmerking komt? We kijken het graag samen met je door.