Hoe krachtige AI-modellen uit te voeren met uw bestaande kantoorcomputers
U wilt krachtige AI-modellen voor uw bedrijf gebruiken. Maar de kosten houden u tegen. Cloud AI-diensten hebben onvoorspelbare rekeningen. Het kopen van speciale AI-servers vereist een enorme voorafgaande investering. Ondertussen staan uw kantoorcomputers 's nachts en in het weekend stil. Hun verwerkingskracht gaat verloren.
Stel dat u de computers die u al bezit, zou kunnen gebruiken om de AI uit te voeren die u nodig heeft?
Wat onderzoekers ontdekten
Onderzoekers bij Intel bewezen dat het mogelijk is. Zij toonden aan dat een groep gewone kantoorcomputers samen kan werken over een gewoon netwerk. Samen kunnen ze een krachtig AI-model uitvoeren dat te groot is voor één computer om alleen af te handelen. U kunt hun volledige paper hier lezen: Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets.
Denk hierbij aan een groepsproject. Één persoon kan een auto niet alleen bouwen. Maar als u vijf personen heeft en elk een onderdeel bouwt - motor, chassis, wielen, interieur, elektronica - kunt u een complete voertuig veel sneller in elkaar zetten. Zo werkt distributed AI-inferentie.
De sleutel ligt in de voorbereiding. De onderzoekers splitsten het AI-model in lagen (genaamd pipeline parallelisme). Vervolgens compileerden ze elk stuk vooraf in een efficiënt, gereed om te draaien programma voor elke computer. Dit is alsof u alle ingrediënten voor een complex recept vooraf snijdt en elk kooklid één specifieke stap geeft. Het gerecht komt snel en betrouwbaar samen.
Deze aanpak laat u modellen serveren die te groot zijn voor het geheugen van één computer. Het paper demonstreert het uitvoeren van een 70-miljard-parametermodel. Dat is een state-of-the-art AI die u kunt gebruiken voor documentanalyse, klantenservice of codegeneratie. U voert het uit op uw eigen locatie met uw hardware. U heeft meer controle over uw gegevens en kosten.
Hoe u dit vandaag kunt toepassen
U hoeft niet te wachten. U kunt beginnen met het opbouwen van uw eigen distributed AI-cluster met de computers die u heeft. Hier zijn vijf concrete stappen om deze week te beginnen.
Stap 1: Inventarisatie van uw bestaande hardware
Eerst moet u identificeren welke computers in uw kantoor kunnen deelnemen. U heeft moderne PCs met specifieke hardware nodig.
Zoek naar deze specificaties:
- CPU: Intel Core Ultra-processoren (Serie 1 of nieuwer).
- AI-accelerator: Een geïntegreerde Neural Processing Unit (NPU). Dit is de speciale chip voor AI-taken.
- Geheugen (RAM): Minimaal 16 GB per machine wordt aanbevolen. Het totale gecombineerde geheugen van alle machines moet groter zijn dan de grootte van het AI-model dat u wilt uitvoeren.
- Netwerk: Alle machines moeten op hetzelfde betrouwbare lokale netwerk zijn (gekabelde Ethernet is het beste).
Actie: Deze week controleert u de specificaties van 5-10 kantoor-PCs die vaak stil staan (zoals werkstations buiten kantooruren). Maak een eenvoudige spreadsheet met hun model, processor, RAM en netwerkverbinding.
Stap 2: Kies uw eerste doel-AI-model
Begin niet met het grootste model. Kies een kleiner, bewezen model voor uw eerste test.
Goede startpunten:
- Llama 3.1 8B: Een 8-miljard parametermodel. Uitstekend voor tekstgeneratie en -analyse.
- Mistral 7B: Een 7-miljard parametermodel bekend om zijn efficiëntie.
Deze modellen zijn krachtig genoeg voor echte bedrijfstaken, maar klein genoeg om te beheren op een startcluster van 2-4 machines.
Actie: Download de Llama-3.1-8B-Instruct-modelbestanden van een betrouwbare bron zoals Hugging Face. U heeft de modelgewichten (meestal een set .safetensors-bestanden) en de tokenizerconfiguratie nodig.
Stap 3: Installeer de core software-stack
U heeft een consistente software-omgeving op elke machine in uw cluster nodig.
Installeer deze belangrijke tools op elke PC:
- Besturingssysteem: Gebruik een stabiele Linux-distributie zoals Ubuntu 22.04 LTS. Dit zorgt voor compatibiliteit met AI-hulpmiddelen.
- Intel® Distribution of OpenVINO™ Toolkit: Dit is de cruciale software. Het is gratis en het is wat de onderzoekers gebruikten om de modellagen vooraf te compileren in efficiënte programma's voor elke PC.
- Docker (Optioneel maar Aanbevolen): Gebruik Docker-containers om uw toepassing te verpakken. Dit garandeert dat elke machine dezelfde software-omgeving uitvoert, waardoor "het werkt op mijn machine"-problemen worden geëlimineerd.
Actie: Op uw eerste testmachine volgt u de officiële OpenVINO-installatiegids voor Linux. Verifieer de installatie door een eenvoudig benchmarkvoorbeeld uit te voeren.

Het figuur uit het onderzoeksrapport toont de systeemarchitectuur. Het AI-model is verdeeld in shards (S1, S2, enz.), elk vooraf gecompileerd en naar een andere PC in de vloot gestuurd. De tekstaanvragen stromen door het netwerk van de ene PC naar de andere, waarbij elk stadium wordt verwerkt.
Stap 4: Compileer en distribueer uw model
Dit is de stap die alles efficiënt maakt. U gebruikt OpenVINO om uw gekozen model te splitsen en voor te bereiden voor elke computer.
Het proces:
- Laad & Split: Laad uw volledige Llama 3.1 8B-model. Split het in lagen. Als u 4 PCs heeft, splitst u het in 4 ongeveer gelijke segmenten.
- Converteer & Compileer: Voor elk segment gebruikt u OpenVINO's modelconversiehulpmiddel. Converteer het van zijn oorspronkelijke formaat (zoals PyTorch) naar een geoptimaliseerd OpenVINO Intermediate Representation (IR)-grafiek. Dit "compileert" het model vooraf voor piekprestaties op de specifieke CPU en NPU van die PC.
- Distribueer: Plaats elk gecompileerd modelsegment (een "shard") op de toegewezen PC. Stel ook een lichtgewicht coördinatiedienst in op één master-PC om de stroom van aanvragen tussen machines te beheren.
Actie: Gebruik het OpenVINO-notebookvoorbeeld voor LLM-pipelineparallelisme als uw startschript. Wijzig het om naar uw gedownloade model te verwijzen en specificeer het aantal shards gelijk aan het aantal test-PCs.
Stap 5: Bouw een eenvoudige testtoepassing
Bewijs dat het systeem werkt met een basis-toepassing voordat u iets complex bouwt.
Maak een eenvoudige Python-client die:
- Verbindt met de mastercoördinator-PC.
- Verzendt een tekstprompt (bijv. "Samenvat de belangrijkste punten uit ons laatste projectmemo.").
- Ontvangt en weergeeft de AI-gegenereerde reactie.
De prompt reist van PC1 (die de eerste modellagen uitvoert) naar PC2, vervolgens PC3, vervolgens PC4. Elke PC voegt zijn deel van de berekening toe. Het definitieve antwoord keert terug naar uw client.
Actie: Schrijf een 50-regels Python-schript met behulp van de requests-bibliotheek om prompts naar uw cluster-API-eindpunt te verzenden. Test het met eenvoudige queries. Meet hoe lang het duurt om een reactie te krijgen.

De onderzoeksresultaten laten zien hoe het toevoegen van meer PCs aan de vloot de algehele doorvoer van het systeem (tokens verwerkt per seconde) verhoogt. Dit demonstreert de schaalbare kracht van deze aanpak.
Waar u op moet letten
Deze aanpak is krachtig, maar heeft beperkingen. Wees u bewust van deze twee belangrijkste uitdagingen.
- Netwerkbetrouwbaarheid is kritiek. Dit systeem maakt uw kantoor-netwerk een centraal onderdeel van uw AI-infrastructuur. Als het netwerk langzaam is of pakketten verliest, zal de prestatie van uw AI erg lijden. Voor een productiesysteem gebruikt u gekabelde Ethernet-verbindingen voor alle deelnemende machines. Vertrouw niet op Wi-Fi.
- Hardwarevereisten zijn specifiek. De methode in het paper is ontworpen voor moderne Intel AI-PCs met NPUs. U kunt geen oudere computers of machines van andere merken gebruiken zonder aanzienlijke extra werk. Uw cluster is alleen zo sterk als de zwakste machine.
Uw volgende stap
Begin met Stap 1 deze week. Maak een inventarisatie van uw kantoorhardware. Vind 3-5 moderne Intel AI-PCs die vaak stil staan. Controleer hun specificaties en noteer hun netwerkverbindingen.
Zodra u uw lijst heeft, heeft u een duidelijke weg. U kunt de hardware die u al heeft betaald gebruiken om een krachtige, on-premises AI-capaciteit op te bouwen. U vermindert uw afhankelijkheid van de cloud, controleert uw gegevens en verandert een kostenpost (stilstand van hardware) in een waardevolle activa.
Hoeveel kan uw team in het komende jaar besparen door slechts één AI-werklast op bestaande computers uit te voeren in plaats van in de cloud?
Reacties
Loading...



