Nederlandse organisatie in de vitale infrastructuur

Een 72B-codemodel op één H100.

Eigen kwantisatie bracht een 72B-codemodel van circa 144 GB naar 66 GB, passend op één H100 met een contextvenster van 90K tokens.

De uitdaging

Ontwikkelaars toegang geven tot krachtige modellen binnen de eigen infrastructuur, met een werkbaar geheugen- en capaciteitsbudget.

Wat is gebouwd

Eigen GPTQ-kwantisatie, private modelserving, een API-gateway met sleutels en gebruikslimieten, en een gedeelde chatomgeving. Ook embeddings, reranking en multimodale modellen passen in die toegang.

Wat de cijfers betekenen

De geheugenreductie beschrijft deze specifieke implementatie. Het is geen algemene kwaliteitsclaim ten opzichte van grotere of externe modellen.

VF / 01REFERENTIEARCHITECTUUR
JOUW OMGEVING01Medewerkers & applicatiesCHAT / API / DEVELOPER TOOLS02Toegang · API-gatewayIDENTITY / LIMITS / ROUTING03AI-agents, retrieval & modellenTOOLS / SOURCES / MODELS04GPU · Opslag · MLOpsKUBERNETES / NVMe-oF / OBSERVABILITYON-PREMISES / EUROPEES GEHOST / AIR-GAPPED
Een gecontroleerde keten. Een heldere grens.
  1. Medewerkers & applicaties: CHAT / API / DEVELOPER TOOLS
  2. Toegang · API-gateway: IDENTITY / LIMITS / ROUTING
  3. AI-agents, retrieval & modellen: TOOLS / SOURCES / MODELS
  4. GPU · Opslag · MLOps: KUBERNETES / NVMe-oF / OBSERVABILITY

REFERENTIE, GEEN NETWERKKAART

Het patroon achter de oplossing.

Een generiek overzicht van de bouwstenen. Technische adressen, interne systemen en klantidentiteiten blijven buiten de publicatie.

Bekijk de architectuur ↗

DE VOLGENDE STAP

Wat moet er bij jullie werken?

Begin met de documenten, het proces of de technische vraag. We denken mee over een passende eerste stap.

Plan een gesprek