På en almindelig laptop med 16 GB hukommelse kan qwen3.5:4b-q4_K_M allerede svare på spørgsmål helt uden internetforbindelse. Det er den samme model som i seriens anden del, og den er en solid assistent til lidt af hvert. Men den skal ikke også stå for søgning i dine filer eller løse kodeopgaver. Henter du én model til det hele, får den for meget at se til, mens tre små modeller hver gør nytte på sit område.
Med lokal AI vælger du selv model og licens. Du bestemmer også, hvilket program der kører modellen, og hvilke data der bliver hvor. Har du endnu ikke tjekket din laptops RAM eller VRAM, så læs først hvor meget RAM din laptop har brug for til lokal AI. Mangler du at installere Ollama, viser guiden til din første lokale AI-udbyder, hvordan du gør. Her går vi ud fra, at begge dele er på plads. Hvilke modeller skal du så vælge, og hvordan finder du ud af, om de er gode?
Et brugbart værktøjssæt til lokal AI dækker tre forskellige opgaver, uden at én model skal klare det hele.
En alsidig assistent til daglig chat, tekstudkast og hurtige spørgsmål: qwen3.5:4b-q4_K_M. Downloaden fylder 3,4 GB, og tagget er det samme som i seriens anden del.
En kompakt specialistmodel til en afgrænset opgave, for eksempel svar i et fast format eller ræsonnement inden for faste rammer: granite4.2:3b. Downloaden fylder 2,2 GB. Modellen udkom i august 2026 med Apache 2.0-licens. I afsnit 6 gennemgår vi også specialister i kodning, matematik, billedforståelse og oversættelse, så du kan vælge en anden model til netop din opgave.
En embedding-model til søgning i dine egne dokumenter: embeddinggemma:300m. Downloaden fylder 622 MB. Den kan ikke chatte, men omsætter tekst til vektorer, som et søgeprogram søger i. Det gennemgår vi nærmere i afsnit 8.
De tre downloads fylder tilsammen omkring 6,2 GB på disken. Det tal er ikke deres samlede hukommelsesforbrug: Har du alle tre indlæst på én gang, kan de bruge mere hukommelse, end din laptop har ledigt. Indlæs derfor én model ad gangen til den opgave, du arbejder på. Mål, hvordan den klarer sig på en konkret opgave, og fjern de modeller, der ikke gør nytte.
Når du sammenligner varianter af samme model, ser du tydeligst, hvad kvantisering gør. I Ollamas katalog er downloadstørrelserne 6,6 GB for qwen3.5:9b-q4_K_M, 11 GB for qwen3.5:9b-q8_0 og 19 GB for qwen3.5:9b-bf16. De bygger på de samme vægte, men har forskellig præcision og downloadstørrelse.
Tallene viser, hvor meget der skal downloades, ikke hvor meget hukommelse modellerne med sikkerhed bruger under kørsel. Lavere præcision giver mindre filer og ofte også lavere hukommelsesforbrug, når modellerne kører. Om det går ud over svarkvaliteten, afhænger af modellen, kvantiseringsmetoden og opgaven. Tag derfor ikke for givet, at den mindre fil er uden omkostninger for svarkvaliteten.
Når modellen kører, er vægtene ikke det eneste, der optager hukommelse. Kontekstvinduet og den tilhørende nøgle-værdi-cache kræver også plads, ligesom alt andet, du har kørende. Selv hvis kvantiseringen frigør hukommelse, er der ingen garanti for, at en større model kan være der. Det gør dog forsøget mere realistisk, end hvis du begynder med filen i fuld præcision.
To betegnelser i modelkataloget er lette at misforstå. Begge kan få dig til at hente noget andet, end du havde regnet med.
Fælde 1. Ifølge Googles eget modelkort har Gemma 4 E2B 2,3 milliarder ”effektive” sprogparametre. Det lyder som en lille fil, men hos Ollama fylder downloadfilen 7,2 GB – næsten lige så meget som Q4-udgaven gemma4:12b på 7,6 GB. Se på downloadstørrelsen, ikke parametertallet, når du vurderer, hvad der er plads til på din laptop.
Fælde 2. Skriver du kun modelseriens navn, kan Ollama hente en anden variant, uden at du opdager det. Henter du blot granite4.2, får du 8B-modellen på 5,3 GB frem for 3B-varianten på 2,2 GB fra afsnit 2. Bruger du qwen3-embedding alene, får du 8B-modellen på 4,7 GB frem for 0,6B-varianten på 639 MB fra afsnit 8.
Løsningen er den samme i begge tilfælde: Brug altid det fulde, præcise tag, ikke kun modelseriens navn, når du henter en model. Tjek downloadstørrelsen, før du går ud fra, at du har fået den variant, du ville teste.
Et maksimum på for eksempel 128K eller 256K tokens i kataloget angiver, hvad modellen i princippet kan tage imod, ikke hvad din laptop med 16 GB hukommelse har plads til.
Ollama bruger som standard et kontekstvindue på 4.096 tokens. Det kan du øge, men både længere kontekst og flere samtidige forespørgsler kræver mere hukommelse. Indstillingen num_ctx: 4096 fra seriens anden del er den samme konservative standardværdi, ikke et tilfældigt valgt tal.
Når du prøver en ny model, så begynd med 4K til 8K tokens og én session ad gangen. Hold undervejs øje med forbruget af systemhukommelse. Udvid først kontekstvinduet, når du har set, at forbruget holder sig stabilt, ikke blot fordi modellen ifølge kataloget teknisk set kan tage imod mere.
Der findes ikke én specialist, der er bedst til alt. Valget afhænger af din opgave, og flere små modeller er værd at prøve af.
Kodning: qwen2.5-coder:3b (1,9 GB) eller den større qwen2.5-coder:7b (4,7 GB). Begge har Apache 2.0-licens.
Matematik eller logik med klare begrænsninger: phi4-mini:3.8b (2,5 GB) fra Microsoft.
Spørgsmål om billeder og skærmbilleder: gemma4:e2b (7,2 GB) eller gemma4:12b Q4 (7,6 GB). Begge har Apache 2.0-licens og er angivet til at kunne tage imod både tekst og billeder.
Skriveopgaver på flere sprog eller oversættelse: aya-expanse:8b (5,1 GB), udviklet til 23 sprog.
En vigtig licensbegrænsning skal stå her og ikke gemmes i en fodnote: Aya Expanse 8B har licensen CC-BY-NC-4.0 med yderligere vilkår og er til ikke-kommerciel brug. Regn derfor ikke med, at den kan bruges på samme vilkår som modellerne med Apache-licens ovenfor. Passer ingen af de fire til din opgave, er granite4.2:3b fra afsnit 2 stadig buddet på en alsidig model til ræsonnement.
Prøv modellerne på din egen opgave, før du vælger. En specialist fortjener sin plads på samme måde som den alsidige assistent: ved at hjælpe dig med en opgave, du giver den – ikke ved at toppe en andens rangliste.
Fem korte test siger mere om en model end nogen katalogside. Giv hver model, du overvejer, de samme fem opgaver med dit eget materiale.
1. Et resumé med belæg i teksten. Giv modellen et notat på 250 ord, og bed den finde tre konkrete handlingspunkter og gengive den sætning i notatet, som hvert punkt bygger på. Markér alle påstande, der ikke har belæg i teksten.
2. Udtræk i fast format. Find på fem aftaler med navne og datoer. Bed modellen om at levere dem som JSON med præcis de felter, du angiver, og tjek alle fem aftaler mod det, du selv skrev.
3. Ret en kodefejl. Giv modellen en lille funktion, der fejler i en test, og selve testen. Notér, om testen består, når modellen har rettet funktionen. Brug det samme kodearkiv og den samme kontekst til alle de modeller, du sammenligner.
4. Et sprogpar. Lad en person, der behersker begge sprog, kontrollere, at navne, tal og nuancer er bevaret i oversættelsen af et realistisk afsnit. Bedøm aldrig en models evner på tværs af sprog ud fra en prompt, der kun er på engelsk.
5. Spørgsmål til et billede, kun for modeller, der kan håndtere billeder. Vis modellen et diagram eller et skærmbillede, og stil et spørgsmål, du kan kontrollere svaret på. Tjek, at selve billedet blev sendt med, ikke kun filnavnet.
For hver test noterer du, om svaret stemmer med dit facit, om modellen fulgte instruktionerne, og hvad den eventuelt fandt på. Notér også, hvor lang tid der går, før du ser det første output, den samlede tid, antal tokens, og om modellen kørte på CPU eller GPU. Vurdér nytte og hastighed hver for sig: En model, der ræsonnerer, før den svarer, kan bruge tid på tokens, du aldrig ser.
Embedding-modellen fra afsnit 2 har én opgave: Den omsætter tekst til vektorer, som et søgeprogram kan søge blandt. Den besvarer ikke selv spørgsmål.
Sådan fungerer det: Dine filer deles først op i tekststykker. Embedding-modellen omsætter hvert stykke til en vektor, som et lokalt vektorlager gemmer. Når du stiller et spørgsmål, omsættes det også til en vektor, og søgningen finder de nærmeste tekststykker. Først derefter bruger en chatmodel de fundne tekststykker til at besvare spørgsmålet og henviser til dem.
Chatmodellen er aldrig blevet trænet på dine dokumenter. Den ser kun det, søgningen sender videre, når du stiller dit spørgsmål.
Du kan afprøve idéen uden den store opsætning: Indeksér fem notater, du allerede har. Stil ét spørgsmål, som et af notaterne giver svar på, og ét, som ingen af dem kan besvare. Hvis opsætningen virker, finder den det relevante tekststykke og citerer det i svaret på det første spørgsmål. Til det andet gør den klart, at der ikke er belæg for et svar, i stedet for at finde på et. Vurdér søgningen og det endelige svar hver for sig.
Kontrollér det fulde tag, før du henter embedding-modellen: embeddinggemma:300m eller qwen3-embedding:0.6b. Bruger du kun modelseriens navn, risikerer du at hente den forkerte variant, som beskrevet i afsnit 4.
En model med en betegnelse som ”26B A4B” aktiverer kun en del af sine parametre for hvert token, den genererer. Vægtene for alle 26B parametre skal dog stadig lagres et sted eller hentes løbende derfra. Færre aktive parametre er altså ikke ensbetydende med en mindre fil eller et lavere hukommelsesforbrug.
Dette værktøjssæt indeholder ingen nye benchmarktal fra egne målinger. Et tal fra en anden kilde skal læses i sin rette sammenhæng. Én person har for eksempel rapporteret cirka 18,5 tokens i sekundet med en usædvanlig 26B mixture-of-experts-opsætning, en ældre CPU og en GPU med 6 GB hukommelse. Det er ét resultat fra én opsætning på vedkommendes eget udstyr, ikke en hastighed, du generelt kan forvente af alle modeller med den betegnelse.
Vi har testet værktøjssættet på to aktuelle laptops, som også var med i seriens anden del: en Apple Silicon-model i den billigere ende og en Windows-workstation med dedikeret grafikhukommelse. Begge er refurbished – professionelt testet, rengjort og istandsat – og har 12 måneders garanti hos refurbed. På begge kan du bruge hele værktøjssættet ovenfor uden problemer.
Den 13-tommers MacBook Air (2026) med M5-chip har som standard 16 GB unified memory og kan konfigureres med op til 32 GB. Dell Precision 7730 har 32 GB systemhukommelse og 6 GB dedikeret NVIDIA-VRAM. De to typer hukommelse ligger i hver sin pulje og skal ikke lægges sammen til ét tal.
Det er ikke en salgstale for nogen af dem. Vi har testet værktøjssættet på netop de to laptops, så du kan sammenligne din egen med konkrete maskiner frem for en reklames specifikationsliste.
Licensen gælder for den konkrete model, ikke automatisk for hele modelserien. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B og Gemma 4 E2B har alle Apache 2.0-licens. Aya Expanse 8B har derimod licensen CC-BY-NC-4.0 med yderligere vilkår og er til ikke-kommerciel brug, som nævnt i afsnit 6. At kunne downloade en models vægte, have ophavsretlig tilladelse til at bruge dem og ”eje” selve modellen er tre forskellige ting. Tjek derfor det aktuelle modelkort for netop den model, du henter, frem for kun at læse om modelserien.
Vil du holde værktøjssættet lille, skal du løbende rydde op. Med ollama rm sletter du en download, der ikke viste sig nyttig. Brug for eksempel ollama rm aya-expanse:8b, når du ved, at du ikke kommer til at bruge modellen. ollama ls viser, hvilke modeller der ligger på disken, mens ollama ps viser, hvilke der er indlæst. Modelkatalogerne ændrer sig, så gennemgå din liste igen frem for blindt at stole på et valg, du traf for flere måneder siden.
Små modeller kan stadig opfinde et tekststykke, overse en nuance på et andet sprog eller skrive kode, der ser rigtig ud, men ikke består testen. Afprøv derfor selv hver anbefaling her. Når noget er vigtigt, erstatter anbefalingerne aldrig en fagpersons gennemgang.
Kan jeg køre alle tre modeller i værktøjssættet samtidig? Det bliver næppe problemfrit på en laptop med 16 GB hukommelse. Indlæs én model ad gangen til den opgave, du skal løse, og skift efter behov mellem den alsidige assistent, specialistmodellen og embedding-modellen.
Kræver embedding-modellen en GPU? Nej. embeddinggemma:300m er lille nok til at teste med CPU alene, men tag tid på testen frem for at regne med, at den er færdig med det samme.
Giver en større model altid bedre svar? Nej. Om en 4B- eller 9B-model klarer sig bedst, afhænger af opgaven. Derfor får du i afsnit 7 en metode med fem testopgaver frem for et enkelt tal fra en rangliste.
Er en Q4-udgave god nok? Det afhænger af opgaven. Har du hukommelse nok til at køre både Q4- og Q8-udgaven af samme model, så sammenlign dem i tre af dine egne test som beskrevet i afsnit 3.
Kan jeg bruge Aya Expanse i et kommercielt projekt? Ikke som udgangspunkt. Licensen CC-BY-NC-4.0 gælder ikke-kommerciel brug, og der er yderligere vilkår. Tjek det aktuelle modelkort, før du går ud fra, at du må bruge modellen kommercielt.
Kræver embedding-modellen internetforbindelse, når du har hentet den? Nej. Når modellens vægte ligger på disken, kører den offline ligesom de øvrige modeller i værktøjssættet.
Installér 4B-assistenten og én specialist til en opgave, du står med, på den laptop, du fik hjælp til at vurdere i del ét og sætte op i del to. Afprøv begge modeller med tre spørgsmål i din egen udgave af testen fra afsnit 7. Behold den model, du har glæde af, og fjern den anden med ollama rm. Overvej først at købe mere hukommelse, når en konkret opgave har vist, at det er hukommelsen, der begrænser dig. En specifikationsliste alene er ikke nok.
Det var den sidste af seriens tre dele. Hvis det viste sig, at din laptop først har brug for mere hukommelse, er laptopkategorien et fornuftigt sted at begynde.
Tilmeld dig vores nyhedsbrev for første gang og spar 115 kr!
Gå aldrig glip af et tilbud igen.
Du kan finde information omkring vores brug af personlig data i vores Privatlivspolitik.
Bekræft tilmelding
Klik på linket i bekræftelsesmailen for at modtage din rabatkode. Den kan anvendes ved køb på en værdi fra 1500 kr.