Hvor meget RAM skal din bærbare have for at køre AI lokalt?

En lille AI-model, der kører på din egen bærbare computer, kan allerede læse tekst, forstå billeder og svare på dine spørgsmål uden at du behøver en konto hos en skytjeneste. Hent filen qwen3.5:4b-q4_K_M (Qwen) på 3,4 GB i aften, så kan modellen gøre netop det på en helt almindelig bærbar computer med 16 GB RAM. Det er en LLM, altså en stor sprogmodel. Hent den med Ollama, stil ét spørgsmål med 4K-kontekst, og så kører du en rigtig AI-model lokalt på hardware, du allerede ejer. Den kan læse tekst og billeder, og her handler det om inferens, ikke træning: Ingen lærer modellen noget nyt, den svarer bare.

Et upræcist "AI PC"-mærkat på æsken er ikke en specifikation. Det er RAM, den hukommelse din GPU kan bruge, lagerplads og reel softwaresupport derimod. 16 GB hukommelse er et reelt udgangspunkt for små AI-modeller. Det er hverken et minimum, man bare kan afskrive, eller et løfte om alt det, et datablad reklamerer med. Mere hukommelse giver mere kontekst og bedre plads til multitasking. 16 GB er nok til at komme i gang.

Hvad bruger egentlig din bærbares RAM, når du kører AI?

En models downloadstørrelse og dens RAM-forbrug under kørsel er to forskellige tal, og at blande dem sammen er den klassiske fejl, når man køber bærbar til AI. De 3,4 GB, du downloader til qwen3.5:4b-q4_K_M, er filen på disken. At indlæse den kræver rigtig hukommelse. Det gør kontekstvinduet også, altså den løbende samtale modellen holder styr på, mens den svarer, kaldet KV-cache. Det samme gælder motoren selv, plus alt det, dit styresystem og andre apps allerede bruger.

Ollama indlæser som standard en kontekst på 4.096 tokens, og du kan hæve den. Kører du flere forespørgsler samtidig, stiger behovet for konteksthukommelse omtrent med antallet af parallelle forespørgsler. En models datablad kan annoncere et kontekstvindue på 128K eller 256K tokens, men se det som modellens loft, ikke som et løfte om, at din bærbare med 16 GB har råd til at bruge det hele på én gang.

RAM, VRAM og unified memory er ikke den samme pulje

Apple Silicon-chips bruger unified memory: CPU og GPU trækker fra den samme pulje på 16, 24 eller 32 GB, så der er ikke en separat grafikhukommelse, der pludselig slipper op. En typisk bærbar med Windows eller Linux og dedikeret NVIDIA-GPU fungerer anderledes. System-RAM og GPU’ens egen VRAM er to adskilte puljer, og 16 GB system-RAM plus en GPU med 8 GB er ikke én samlet pulje på 24 GB, som en model frit kan bruge.

Når en model ikke kan være helt på GPU’en, kører en del af den på CPU’en i stedet. Den delvise offload kan gøre en model, der teknisk set kan indlæses, mærkbart langsommere i brug. Kør , så kan du se den præcise CPU/GPU-fordeling for det, der er indlæst lige nu.

Kapacitet er kun halvdelen af historien. Hastigheden på hukommelsen betyder mindst lige så meget: Apple oplyser 153 GB/s hukommelsesbåndbredde på MacBook Air M5, og båndbredde, ikke kun størrelse, er en vigtig grund til, at unified memory føles hurtigt i praksis og ikke bare lige akkurat slår til.

Kvantisering: Sådan bliver en AI-model på 9B lille nok til din RAM

Kvantisering er forklaringen på det download på 3,4 GB: Når en models vægte gemmes med lavere numerisk præcision, bliver filen mindre, og Qwen3.5’s egen 9B-model viser spændet tydeligt. Den samme 9B-model fylder 6,6 GB som Q4_K_M, 11 GB som Q8_0 og 19 GB i fuld BF16-præcision. Samme model, samme antal parametre, tre meget forskellige downloadstørrelser. Og igen: Det er downloadstørrelsen, ikke den RAM der kræves under kørsel.

Lavere præcision koster som regel noget kvalitet, men hvor meget afhænger af opgaven, ikke af en fast procentsats. En praktisk detalje, der er god at kende, før du vælger Qwen som din første model: Nogle brugere oplever, at dens "tænke"-trin giver en mærkbar forsinkelse, før svaret kommer, sammenlignet med modeller der svarer mere direkte. Det er værd at prøve begge stilarter på dine egne opgaver i stedet for at gå ud fra, at den ene bare er bedre.

Har du allerede en MacBook med 16 GB? Prøv det her, før du køber noget

Hvis du allerede har en MacBook med 16 GB, så begynd med en 2-4B-model i Q4-præcision og en 4K-kontekst, før du overvejer at købe noget andet. En 9B Q4-model eller noget i stil med Gemma 4 12B QAT kan måske også indlæses. Om det lykkes, afhænger af hvor mange andre apps der er åbne, hvor meget kontekst du bruger, og hvor varm maskinen allerede er under belastning, så se det som noget, der er værd at prøve, ikke som en garanti.

Vil du købe en ny specifikt til det her? MacBook Air 13-tommer med M5-chip kommer som standard med 16 GB unified memory og kan konfigureres op til 32 GB. Og før den større skærm frister som opgradering: 15-tommer M5 Air starter med de samme hukommelsesmuligheder på 16, 24 og 32 GB og den samme båndbredde på 153 GB/s som 13-tommermodellen. Vælg skærmstørrelse ud fra komfort, ikke fordi du tror, den giver mere plads til AI. Det gør den ikke.

MacBook Air 13-tommer med M5-chip

Har du allerede en bærbar med 16 GB og Windows eller Linux? Start her

En bærbar med Windows eller Linux og 16 GB uden dedikeret GPU kan stadig køre en lille model. Ollama kører direkte på Windows, så hent en 2-4B Q4-model og prøv den på CPU’en eller den integrerede grafik, før du bruger penge på noget som helst. Forvent større forskelle i oplevelsen end på Apple Silicon: Der findes ikke ét fast tal for tokens pr. sekund, der gælder på tværs af alle maskiner, for ingen har målt hver eneste konfiguration.

Lenovo ThinkPad T14 G2 og HP EliteBook x360 1040 G7 har begge 16 GB RAM og integreret grafik, altså præcis denne klasse. En ting, der er værd at tjekke først, især på en ældre refurbished maskine som de her to: LM Studio kræver AVX2-understøttelse på Windows x64, og det instruktionssæt findes ikke på alle ældre CPU’er. Bekræft derfor, at netop din processor understøtter det, før du går ud fra, at enhver bærbar i denne klasse kan køre det værktøj, du har valgt.

Lenovo ThinkPad T14 G2 bærbar

GPU-fælden i bærbare: Derfor er "RTX 5070 Ti" ikke bare ét tal

NVIDIAs GPU’er til bærbare deler navn med desktopkort, og det navn fortæller mindre, end man skulle tro. RTX 5060 Laptop GPU kommer med 8 GB GDDR7-hukommelse og et oplyst effektområde på 45 til 100 watt. RTX 5070 Ti Laptop GPU kommer med 12 GB GDDR7 og 60 til 115 watt. Et resultat online for en desktop-RTX 5070 Ti er ikke det samme som et resultat for en RTX 5070 Ti Laptop GPU, uanset hvad navnet antyder.

Der gemmer sig en anden fælde i det samme navn. To bærbare kan begge have en "RTX 5070 Ti Laptop GPU" og stadig yde forskelligt under vedvarende belastning: Et tyndt og let kabinet og et tykkere og tungere håndterer varme forskelligt, og det samme GPU-navn er ingen garanti for samme hastighed i praksis, når blæserne har kørt et stykke tid. Tjek altid den præcise VRAM-mængde og den bærbares egen effektkonfiguration, ikke kun GPU-familiens navn.

Køber du en ny Mac? Her er det behagelige niveau for unified memory

Hvis du køber specifikt for jævnligt at kunne køre lokal AI, er 24 til 32 GB unified memory det mere komfortable Apple-niveau. Det giver reel plads til en større model, længere kontekst eller bare til at holde andre apps åbne, mens du arbejder. Vælg 32 GB, hvis du regner med at bruge det ofte, og budgettet tillader det.

MacBook Pro 13-tommer med M2-chip er et konkret refurbished eksempel, som allerede ligger over startniveauet på 16 GB: Dens 8-core CPU og 10-core GPU kan kombineres med op til 24 GB unified memory. Det er en ældre chipgeneration end M5 Air, så her er det modellens eget loft på 24 GB, du skal forvente, ikke M5 Airs særskilte muligheder på 24/32 GB.

MacBook Pro 13-tommer med M2-chip

Køber du en ny bærbar med Windows eller Linux? Kig efter en dedikeret GPU

Skal du købe en ny bærbar med lokal AI som hovedformål, så kig efter 32 GB system-RAM sammen med en dedikeret NVIDIA-GPU til bærbare med mindst 8 GB egen VRAM, og helst 12 GB, hvis en lidt tungere eller dyrere bærbar er en acceptabel byttehandel. 8 GB er et realistisk mål for 4-7B-modeller i Q4-præcision med moderat kontekst, men gå ikke ud fra, at det automatisk giver rigelig plads: Selv downloadet på 6,6 GB til en 9B Q4-model kan kræve mere end bare 8 GB for at køre komfortabelt, og 12 GB gør det ganske enkelt lettere at teste i den størrelse.

Dell Precision 7730 er et konkret refurbished eksempel på idéen bag, om end ikke med præcis de nye chips nævnt ovenfor: 32 GB systemhukommelse står side om side med en dedikeret NVIDIA Quadro P3200 med sine egne 6 GB VRAM, en anden GPU-generation og -klasse end NVIDIAs nuværende RTX 5060 og 5070 Ti Laptop GPU’er, men efter det samme princip med separate hukommelsespuljer.

Dell Precision 7730 mobil workstation

Et ansvarligt alternativ: AMD-laptopchips med meget hukommelse

AMD’s Ryzen AI Max+ 395-processor understøtter op til 128 GB LPDDR5x-systemhukommelse, afhængigt af hvordan den færdige bærbar er konfigureret. Det er en anden hukommelsesarkitektur, som er værd at kende, og den kommer med en reel udfordring: På Ollamas ROCm-supportliste til Linux står denne chip nævnt, mens den aktuelt ikke gør på ROCm-listen til Windows.

Det er en grund til at kontrollere den præcise installerede hukommelse, operativsystemet, GPU-backend, driver og Ollama-adfærd på en konkret bærbar, før man anbefaler den, ikke en grund til at afvise chippen på forhånd. Se derfor en AMD-bærbar med meget hukommelse som en interessant alternativ arkitektur, der fortjener grundig research, ikke som det oplagte første køb for en, der er ny i lokal AI.

Softwaren bag: Ollama og LM Studio i helt almindelige ord

Ollama er den enkleste måde at få en model til at svare på din egen maskine: Hent en model, kør den, og så har du en lokal server, der besvarer forespørgsler, uden cloudkonto for en downloadet model. Det er værktøjet bag alle eksemplerne her.

LM Studio er det grafiske alternativ med sin egen modelbrowser og chatfunktion. Det oplyser også sine egne minimumskrav: mindst 16 GB RAM på Mac eller Windows, AVX2-understøttelse krævet på Windows x64 og 4 GB dedikeret VRAM anbefalet på Windows. Det er et emne for sig at sætte begge dele rigtigt op.

Og en vigtig detalje, før du stoler på ét enkelt hastighedstal, du har læst online: Det officielle værktøj llama-bench skelner mellem hastigheden på promptbehandling og generationshastighed og viser variation på tværs af gentagne testkørsler i stedet for ét enkelt tal. Et forumindlæg med ét tal for tokens pr. sekund siger sjældent, hvilken af de to målinger der er tale om, eller hvor mange gange testen er kørt.

Tjekliste før du køber eller opgraderer til en AI-klar bærbar

Før du køber eller opgraderer specifikt til lokal AI, så tjek detaljerne i stedet for markedsføringen.

Præcis GPU-model og VRAM. Ikke kun GPU-familiens navn, men den nøjagtige variant til bærbare og dens egen hukommelsesmængde, fordi det samme navn kan dække over forskellig VRAM.

Fastloddet eller opgraderbar RAM. Nogle bærbare giver dig mulighed for at tilføje mere hukommelse senere, mange moderne tynde og lette modeller gør ikke. Du skal vide, hvilken type du køber.

Ledig SSD-lagerplads. Modeldownloads spænder fra under en gigabyte til langt over ti, og en voksende samling fylder hurtigt sammen med dine andre filer.

Termisk adfærd under vedvarende belastning. En model, der besvarer ét spørgsmål, og en bærbar, der håndterer flere forespørgsler i træk, er to forskellige test. Blæserstøj og throttling efter gentagne prompts fortæller mere end en enkelt hurtig demo.

Understøttelse af styresystem og drivere. Bekræft, at netop din kombination af GPU-backend og operativsystem understøttes af Ollama eller LM Studio, før du går ud fra det.

NPU-tallet i TOPS på æsken er ingen garanti for gennemløb. Det er et markedsføringstal, ikke et testet resultat fra den motor, du faktisk vil bruge. Et upræcist "AI PC"-mærkat erstatter ikke nogen af tjekpunkterne ovenfor.

Ofte stillede spørgsmål om at køre AI på en bærbar

Skal jeg have en dedikeret GPU for at køre AI lokalt?

Nej. En lille model kan køre på CPU eller integreret grafik på mange bærbare med 16 GB, bare med større forskelle i hastighed end på en bærbar med dedikeret GPU. Start med en 2-4B-model, før du går ud fra, at du overhovedet har brug for dedikeret grafik.

Virker 8 GB RAM?

Ikke komfortabelt til de modeller, der er gennemgået her. 16 GB er det realistiske udgangspunkt, når man tager højde for, at modellen, dens kontekstvindue, motoren og dit styresystem deler den samme hukommelse.

Er det samme at køre en model lokalt som at træne en?

Nej. Alt ovenfor handler om inferens: at stille spørgsmål til en allerede trænet model. Træning bygger en model fra bunden og kræver langt mere hardware end nogen af de bærbare her.

Garanterer mere RAM hurtigere svar?

Nej. Mere hukommelse giver plads til større modeller, længere kontekst og flere åbne apps, men den konkrete hastighed afhænger af hukommelsesbåndbredde, GPU-backend og den konkrete model, ikke kun af hukommelsens størrelse.

Er mine data private, når en model kører lokalt?

Ja, i den forstand at dine prompts bliver på din egen maskine i stedet for at blive sendt til en cloududbyder. Ollama binder som standard til din egen bærbare og sender ikke forespørgsler andre steder hen, medmindre du bevidst sætter cloudadgang op.

Prøv det i aften, og køb bagefter med ro i maven

Har du allerede en bærbar med 16 GB? Installer Ollama i aften, og kør en lille model, før du bruger en krone på noget nyt. Køber du specifikt til det her? Så brug tjeklisten ovenfor og de fem refurbished bærbare, vi lige har gennemgået, som dit første sammenligningsgrundlag i stedet for et markedsføringspræget datablad.

Alle bærbare på refurbed bliver testet og vurderet, før de bliver sat til salg, så den RAM og den konfiguration, du køber, er også den RAM og den konfiguration, du får. Den næste guide i serien gennemgår, hvordan du forbinder din første app med modellen, du lige har prøvet.

MacBook Air åben på et skrivebord, klar til at køre en lokal AI-model

Tilmeld dig vores nyhedsbrev for første gang og spar 115 kr!

Gå aldrig glip af et tilbud igen.

Du kan finde information omkring vores brug af personlig data i vores Privatlivspolitik.