Kør AI lokalt på din bærbare: din første personlige AI-tjeneste

Din bærbare besvarer et spørgsmål helt uden internet. Bagefter får en anden app på samme computer svar på præcis det samme spørgsmål, uden at du ændrer noget. Så bliver den bærbare, du allerede bruger, til en lille, personlig AI-tjeneste, som andre apps og scripts kan sende forespørgsler til.

Guiden handler om at køre en model, du har downloadet, ikke om at træne en. Har du endnu ikke tjekket, om din bærbare har nok RAM eller VRAM, så læs først hvor meget RAM din bærbare skal have til lokal AI. Ved du allerede, at din computer har, hvad der skal til, kan du gå videre.

De fire lag i en lokal AI-opsætning

En lokal AI-opsætning består af fire adskilte lag. Når du ved, hvad de hver især gør, bliver trinene herunder lettere at følge.

Modelvægtene er filen, du downloader, for eksempel en kvantiseret udgave af en lille model på 3,4 GB. Tallet angiver filens størrelse på disken, ikke hvor meget RAM modellen skal bruge, når den kører.

Inferensmotoren er programmet, der indlæser modelvægtene og besvarer forespørgsler. Her bruger du Ollama, som kører sin egen lokale HTTP-API. Motoren gør din bærbare til en AI-tjeneste, som andre apps kan bruge.

Frontenden sender forespørgslen og afgør, om en prompt bliver på din bærbare eller sendes et andet sted hen. Det kan være Ollamas indbyggede chat, et lille script eller en separat app.

Et valgfrit dokumentindeks gør det muligt for en chatmodel at søge i dine egne filer. Det kræver en separat embeddingmodel og sin egen lagerplads. Indekset oprettes ikke automatisk, og vi gennemgår det ikke her.

Kort fortalt: En app eller et script kontakter Ollama på 127.0.0.1:11434. Programmet indlæser den model, du har downloadet. Hvis du sletter modellen, bliver den chathistorik, som en frontend har gemt, ikke slettet. Modellen og chathistorikken ligger hver sit sted.

Inden du installerer: Ligner din bærbare en af de to?

Inden du installerer noget, så brug to minutter på at notere, hvor meget RAM din bærbare har, hvilket styresystem og hvilken processor den bruger, om den har dedikeret grafikhukommelse (VRAM), og hvor meget plads der er ledig på SSD'en. Hele forklaringen på behovet for RAM og VRAM til lokal AI finder du i guiden til, hvor meget RAM din bærbare skal have til lokal AI.

De to bærbare nedenfor findes lige nu hos refurbed. Begge er refurbished: De er testet, rengjort og istandsat af fagfolk og har 12 måneders garanti. Den ene er en Apple Silicon-model fra Apples indgangsklasse, den anden en Windows-bærbar med dedikeret grafikhukommelse. Du kan følge alle trin nedenfor på begge bærbare.

Installer Ollama på macOS, Windows eller Linux

Hent den officielle Ollama-app til macOS eller Windows, eller følg vejledningen til installation på Linux. Åbn Ollama, når installationen er færdig. På Linux kører du ollama serve, hvis serveren ikke allerede er klar til at modtage forbindelser.

I den nuværende app kan du både køre modeller lokalt og bruge cloudtjenester. Når du har hentet modellen, skal du derfor vælge dens lokale modeltag. Det kræver ikke login at køre den.

Vil du følge guiden, skal du hente netop qwen3.5:4b-q4_K_M. Downloaden fylder 3,4 GB. Det præcise tag er vigtigt: En generisk betegnelse som ”latest” kan dække over en langt større model end den, du har testet, uden at du opdager det. De 3,4 GB er filens størrelse på disken, ikke et mål for, hvor meget RAM modellen skal bruge, når den besvarer forespørgsler.

Hent din første model, og tag hul på samtalen

Med to kommandoer er du i gang med din første samtale med en model:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

Den første kommando henter modellen, og den anden åbner en interaktiv chat med den. Giv den en lille, konkret opgave frem for bare at sige hej. Skriv for eksempel: ”Lav en opgaveliste ud fra disse tre mødenoter. Lad være med at finde på datoer.”

Når du er færdig, forlader du chatten ved at skrive /bye.

Kald Ollamas API: AI kører nu lokalt på din bærbare

Når du chatter i terminalen, taler frontenden med inferensmotoren. Nu kontakter du den samme motor direkte, ligesom en anden app ville gøre.

På macOS eller Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Definér lokal inferens i én sætning."}],"stream":false,"options":{"num_ctx":4096}}'

I PowerShell på Windows:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Definér lokal inferens i én sætning."}],"stream":false,"options":{"num_ctx":4096}}'

Find message.content i svaret. Sætter du stream til false, kommer hele svaret på én gang i stedet for i flere dele. Med num_ctx: 4096 ligger kontekstindstillingen i denne første test langt under modellens oplyste maksimum.

Hvad du kan læse ud af svaret

Selve svaret står i message.content, men Ollama sender også felter, der er værd at se nærmere på: load_duration, prompt_eval_count, prompt_eval_duration, eval_count og eval_duration.

Felterne viser tilsammen, hvor lang tid det tager at indlæse modellen i hukommelsen, og hvor lang tid det tager at generere svaret. Den forskel kan du ikke se af ét enkelt tal for ”tokens pr. sekund”. Den første forespørgsel efter opstart af Ollama er som regel den langsomste, fordi modellen først skal indlæses. Det skal den ikke ved den næste forespørgsel.

Tallene afhænger helt af din computer, så vi angiver ikke nogen typiske tal. Sammenlign felterne fra to kørsler på samme bærbare i stedet for at stole på én enkelt påstand om hastighed.

Se, hvad der kører: ps, ls og frigivelse af RAM ved inaktivitet

Tre kommandoer er nok til det vigtigste i det daglige.

ollama ps viser, hvilke modeller der er indlæst lige nu, og hvor de kører. I processorkolonnen står der 100 % GPU, 100 % CPU eller en fordeling mellem de to.

ollama ls viser alle de modeller, du har hentet.

ollama rm qwen3.5:4b-q4_K_M sletter den downloadede model, du ikke længere har brug for.

Når en model har været inaktiv i fem minutter, fjerner Ollama den som standard fra hukommelsen. Viser ollama ps ingen indlæste modeller, så send endnu en forespørgsel, før du går ud fra, at noget er galt.

Tilslut en anden app til Ollamas lokale OpenAI-kompatible API

Nu kan din bærbare også besvare forespørgsler fra en anden app end Ollamas egen chat. Indstil appen til at kontakte Ollama på din bærbare i stedet for en cloudtjeneste.

De fleste apps, hvor du selv kan angive adressen på et OpenAI-kompatibelt API, beder om tre oplysninger: en basis-URL, et modelnavn og en API-nøgle. Angiv http://localhost:11434/v1/ som basis-URL og qwen3.5:4b-q4_K_M som modelnavn.

API-nøglefeltet kan drille: Nogle apps accepterer ikke, at det står tomt. Derfor bruger Ollama pladsholderen api_key='ollama' i sin dokumentation og forklarer, at den lokale server kræver, at feltet er udfyldt, men ignorerer selve værdien. Pladsholderen bruges ikke til at bekræfte nogens identitet; den udfylder blot feltet og er ikke en adgangskode.

Kompatibiliteten gælder dog kun nogle af funktionerne i de enkelte API'er. Vil du for eksempel bruge billeder som input eller kalde værktøjer, så afprøv den konkrete funktion i din app i stedet for at gå ud fra, at alle funktioner virker.

Bevis det: Gentag din forespørgsel uden netforbindelse

Selv efter de foregående trin kan dine forespørgsler i teorien stadig blive sendt ud på nettet, uden at du opdager det. Sådan udelukker du den mulighed.

Når modellen er hentet, slår du Wi-Fi fra på din bærbare eller trækker netværkskablet ud. Gentag så præcis den samme forespørgsel som før, enten i chatten eller via API'en. Får du et egentligt svar helt uden netforbindelse, har du bevis for, at modellen kører lokalt.

Følgende tæller ikke som bevis: et svar, du kun får, mens du er online, et svar fra https://ollama.com i stedet for localhost og brug af et cloudmodeltag frem for en downloadet model. Ollama holder lokale forespørgsler på din computer. Forespørgsler til de særskilte cloudmodeller går derimod via en ekstern tjeneste.

Hold din offline AI-assistent privat: beskyt adgangen

Privatliv kommer ikke af sig selv. Derfor er det værd at vide, hvad der beskytter dig, og hvad der ikke gør.

Ollama lytter som standard kun på 127.0.0.1:11434, så den kun kan kontaktes fra din egen bærbare. Lad det være sådan. Brug ikke OLLAMA_HOST=0.0.0.0, og videresend heller ikke port 11434 til det offentlige internet. Pladsholderen i API-nøglefeltet fra før kontrollerer ikke, hvem der får adgang. Åbner du porten mod internettet, står døren åben for alle.

Med et downloadet, lokalt modeltag kører modellen allerede lokalt. Du kan også slå Ollamas egne cloudfunktioner helt fra, men det er valgfrit. Tilføj {"disable_ollama_cloud": true} til ~/.ollama/server.json, eller indstil OLLAMA_NO_CLOUD=1. Genstart derefter Ollama, så ændringen træder i kraft.

Vil du bruge opsætningen fra et andet rum eller en anden enhed, er det en særskilt og mere avanceret opgave. Det kræver et privat netværk og en proxy med adgangskontrol foran Ollama. Den del gennemgår vi ikke her. At åbne porten direkte mod internettet er ikke løsningen.

Hvis noget driller

Her er en kort oversigt over de mest almindelige problemer og det første, du bør tjekke.

Forbindelsen afvises. Tjek, at Ollama-appen eller ollama serve kører, og prøv igen.

Det første svar er langsomt, de næste hurtigere. Det skyldes, at modellen først skal indlæses, ikke at selve svaret genereres langsommere. Sammenlign værdierne i de svarfelter, vi gennemgik tidligere, for at se forskellen.

Det hele virker meget langsommere end ventet. Kør ollama ps. Kommandoen kan vise, om modellen kun kører på CPU, eller om belastningen er fordelt mellem CPU og GPU. Tjek, om din GPU og dens drivere understøttes på netop dit styresystem.

Hukommelsen er presset, eller programmet går ned. Vælg et tag for en mindre model, sænk num_ctx, og luk andre programmer, der bruger meget hukommelse, før du prøver igen.

Disken er ved at være fuld. Brug ollama ls til at se, hvilke modeller du har downloadet, og ollama rm til at fjerne dem, du ikke bruger.

Hvis denne fremgangsmåde ikke passer dig, fordi du for eksempel vil kunne gennemse modeller i en grafisk brugerflade eller styre CPU og GPU mere præcist, er LM Studio og llama.cpp værd at se nærmere på. Det taler for at skifte motor, ikke for at køre to opsætninger side om side.

Ofte stillede spørgsmål om lokal AI på din bærbare

Skal jeg være online efter opsætningen? Nej. Når modellen er hentet, kan du både chatte med den og sende forespørgsler via API'et helt uden internetforbindelse.

Beskytter pladsholderen i API-nøglefeltet mit lokale API? Nej. Ollamas lokale server godtager enhver værdi, der ikke er tom, uden at kontrollere den. Den nøgle, nogle apps beder om, er derfor ikke en sikkerhedsforanstaltning.

Bliver min prompt på min bærbare? Ja, hvis du bruger et lokalt modeltag til en model, du har downloadet. Ollama har også særskilte cloudmodeller, som bruger en ekstern tjeneste. Om din prompt bliver på computeren, afhænger af, hvilket tag du vælger, ikke af en skjult standardindstilling.

Skal jeg have et dedikeret grafikkort? Nej. En bærbar, der kun bruger CPU'en, kan køre en lille model, men det går typisk langsommere. ollama ps viser præcis, hvordan en bestemt forespørgsel blev behandlet.

Hvordan skifter jeg til en større eller en anden model? Tjek først, hvor meget RAM og VRAM du har, og skift derefter modeltagget i både ollama pull og ollama run. Læs hele forklaringen i guiden om hvor meget RAM din bærbare skal have til lokal AI.

Kan modellen fremover huske mine dokumenter? Nej. En chatmodel husker ikke af sig selv indholdet af en mappe permanent. Vil du søge i dine egne filer, kræver det et særskilt dokumentindeks. Den valgfri opsætning gennemgår vi ikke her.

Din tur: Giv din egen AI-tjeneste en opgave

Vælg én konkret opgave, og prøv den både i den indbyggede chat og i den app, du lige har tilsluttet. Du kan for eksempel opsummere et personligt notat, sortere en samling filer i navngivne grupper eller få et kort stykke kode forklaret i almindeligt sprog.

Uanset hvilken opgave du vælger, så skriv følgende ned: det præcise modeltag, motorens version, kontekstindstillingen, den anvendte URL og selve opgaven. Så kan du eller andre, der vil prøve det samme, genskabe resultatet senere.

Hvis din bærbare viser sig at have for lidt RAM eller VRAM til opgaven, er det værd at overveje at opgradere til en med mere hukommelse. Næste artikel i serien handler om at sammensætte en lille værktøjskasse med modeller: én til chat, én til kode og én til søgning.

Refurbished bærbar, der egner sig til at køre AI lokalt og fås hos refurbed

Tilmeld dig vores nyhedsbrev for første gang og spar 115 kr!

Gå aldrig glip af et tilbud igen.

Du kan finde information omkring vores brug af personlig data i vores Privatlivspolitik.