Ovaj vodič je informativan. Uvijek provjerite kako se pravila primjenjuju na vaš konkretan predmet.
Pozicija u toku: nakon snimanja i Whisper-transkripcije, kao deo U kontaktu sa vlastima.
Ukratko
- Najbolja privatnost: pokrenite LLM potpuno lokalno (Ollama / LM Studio) – tekst nikada ne napušta vaš računar.
- Sledeće najbolje: privremeni, izolovani GPU pod (npr. RunPod Secure Cloud) koji sami pokrećete, učitavate model, koristite i zatim brišete – nije ChatGPT/Claude-cloud chat.
- Izbegavajte za osetljive slučajeve: potrošački cloud gde lepite ceo dosije u chat koji trenira na ili beleži ulazne podatke.
Za šta je lokalni LLM koristan u poslovima sa vlastima
Jezički model (LLM) ne zamenjuje pravno savetovanje. On je radni alat kada već imate snimak, transkripciju ili tražene dokumente. Tipični zadaci:
- Sumiranje dugog transkripta sastanka: odluke, obećanja, rokovi, nejasne tačke.
- Poređenje vaše transkripcije sa službenom beleškom i navođenje razlika tačku po tačku.
- Predlaganje strukture za ispravku, odgovor ili prateći mejl (vi pišete i proveravate činjenice).
- Prevođenje na vaš jezik, ali zadržavanje švedskih pravnih termina u zagradi.
- Pronalaženje rokova i “šta treba da tražim pismeno?” u složenom tekstu.
Nikada ne dozvolite modelu da “izmišlja” citate. Zamolite ga da označi nesigurne delove i uvek proverite važne rečenice sa zvučnim zapisom ili originalnim dokumentom.
Stepeni privatnosti: tri nivoa
- Potpuno lokalno (preporučuje se za decu, socijalne službe, zdravstvo, migraciju, policiju): model + chat se pokreću offline na vašem računaru. Nema učitavanja.
- Izolovani GPU koji kratko iznajmljujete (RunPod Secure Cloud, slično): podaci napuštaju računar, ali idu u pod koji vi kontrolišete, a ne u opštu chat uslugu za treniranje. Zahteva strogu rutinu brisanja (vidi ispod).
- Opšti cloud-AI (ChatGPT, Claude.ai, Gemini i dr.): najjednostavnije – ali osetljivi lični podaci treba da budu strogo maskirani ili da se uopšte ne šalju. Pročitajte uslove; pretpostavite da se ulazni podaci mogu beležiti.
Kako pokrenuti LLM lokalno
Alternativa A: Ollama (Mac, Windows, Linux) – najjednostavnije za mnoge
- Instalirajte Ollama sa ollama.com.
- Preuzmite model, npr.
ollama pull llama3.1:8bili švedski/europski fino podešen model koji se nalazi u Ollama katalogu i staje u vašu memoriju. - Pokrenite chat:
ollama run llama3.1:8bili koristite Ollama aplikaciju/web interfejs. - Zalepite (ili priložite) radnu kopiju transkripcije – ne ceo zvučni zapis.
- Radite offline: isključite nepotrebnu cloud sinhronizaciju za folder sa osetljivim fajlovima.
Alternativa B: LM Studio – grafički i dobro za početnike
- Instalirajte LM Studio.
- Preuzmite GGUF model (počnite sa 7B–8B kvantizovanim, npr. Q4/Q5).
- Učitajte model lokalno. Proverite da li je izabrano “local server” / offline i da ništa nije poslato u cloud.
- Koristite chat ili lokalni API (često
localhost) sa sopstvenog računara.
Alternativa C: GPT4All ili llama.cpp
Dobro funkcioniše na starijim računarima. Isti princip: preuzmite model fajl jednom, pokrenite offline, držite osetljive tekstove van cloud sinhronizacije.
Prompts koji funkcionišu u poslovima sa vlastima
Vi ste pravni jezički asistent, a ne advokat. Sumirajte tekst na jednostavnom švedskom. Podelite na: 1) odluke/obaveštenja, 2) obećanja od strane vlasti, 3) šta treba da uradim, 4) rokovi, 5) nejasne tačke koje treba da tražim pismeno. Ne menjajte citate. Obeležite nesigurne delove sa [nesigurno].
Uporedite TEKST A (moja transkripcija) sa TEKSTOM B (beleška vlasti). Navedite samo konkretne razlike: datumi, citati, ko je šta rekao, nedostajuće tačke. Ne izmišljajte razlike. Ako je nešto nejasno, napišite “ne može se utvrditi”.
Napišite kratak nacrt odgovora/ispravke (maksimalno 200 reči) na osnovu razlika. Sam ću proveriti svaku tvrdnju sa izvorom pre nego što pošaljem.
Šta je potrebno da računar postigne
Brojevi su smernice za kvantizovane modele (GGUF Q4/Q5). Puna preciznost zahteva više. Švedski i dugi transkripti zahtevaju više radne memorije (konteksta) nego kratki chatovi.
| Cilj | Veličina modela | Memorija / GPU | Očekivani osećaj |
|---|---|---|---|
| Minimalno sumiranje | ~3B–4B | 8 GB RAM, bez GPU | Sporo ali korisno na laptopu |
| Dobra svakodnevna analiza (preporučeni početni nivo) | ~7B–8B Q4/Q5 | 16 GB RAM, ili 8 GB VRAM | Prihvatljiva brzina na modernom laptopu/Mac-u |
| Dugi dosijei / bolje rezonovanje | ~13B–14B Q4/Q5 | 32 GB RAM, ili 12–16 GB VRAM | Primetno bolji kvalitet, zahtevnije |
| Teški modeli / mnogi fajlovi | 32B+ ili 70B kvantizovan | 48 GB+ RAM ili 24 GB+ VRAM | Često bolje na iznajmljenom GPU nego na kućnom računaru |
- Apple Silicon (M1/M2/M3/M4): 16 GB objedinjene memorije često je dovoljno za 7B–8B. 32 GB daje više prostora za duže dokumente.
- Windows/Linux sa NVIDIA: CUDA podrška u Ollama/LM Studio daje veliku brzinsku prednost. 8 GB VRAM ≈ udobno 7B–8B; 12–16 GB VRAM otvara 13B.
- Samo CPU: funkcioniše, ali računajte na minute po odgovoru za duži tekst. Podelite dokument na odeljke.
- Disk: računajte 4–8 GB po model fajlu; imajte 20+ GB slobodnog prostora.
- Whisper + LLM istovremeno: pokrenite ih redom kako bi memorija bila dovoljna.
Ako računar ne može da izdrži: koristite manji model, kraće odlomke, ili privremeni izolovani GPU (sledeće poglavlje) – ne opšti cloud chat sa nemaskiranim dosijeom.
RunPod i druge izolovane GPU okoline – da li su bezbedne za privatnost?
Kratak odgovor: To je sigurnije nego kopirati ceo dosije u ChatGPT, ali nije tako sigurno kao raditi potpuno lokalno. Podaci napuštaju vaš računar i obrađuju se u nečijem drugom datacentru. Za mnoge slučajeve dovoljna je dobro održavana Secure Cloud pod. Za zaštićene lične podatke, ozbiljne slučajeve u zdravstvu/socijalnim službama ili kada želite maksimalnu kontrolu: ostanite lokalno ili snažno maskirajte.
Šta “izolovana pod” znači u praksi
- Unajmljujete GPU kontejner (pod) gde vi pokrećete npr. Ollama, text-generation-webui ili vLLM.
- Model i vaš tekst se pokreću u tom kontejneru – ne u deljenom potrošačkom četu sa logovima miliona korisnika.
- Kod RunPod-a često se pravi razlika između Community Cloud (deljeni host, jeftiniji) i Secure Cloud (posvećeni/više izolovani hardver kod dobavljača). Za osetljiv materijal: izaberite Secure Cloud (ili odgovarajuću posvećenu opciju kod drugog dobavljača).
- Ephemeral disk se često briše kada se pod zaustavi. Persistent “network volume” ostaje dok ga vi ne uklonite – ne zaboravite da obrišete.
Kada RunPod (ili slično) može biti razumno
- Vašem računaru nedostaje memorija/GPU za model koji vam je potreban.
- Treba da analizirate mnogo stranica u kratkom periodu (7–70B modeli).
- Možete pratiti proceduru brisanja ispod i izbegavati skladištenje više nego što je potrebno u podu.
Kada treba izbegavati iznajmljeni GPU
- Zaštićeni lični podaci, ozbiljni slučajevi sa decom, ili kada ne želite da materijal uopšte napusti dom.
- Niste sigurni u region/skladištenje ili želite zagarantovano “zero data retention” – to dobijate prvenstveno tako što nikada ne učitavate.
- Potreban vam je samo jednostavan rezime – tada je obično dovoljna 7B–8B model lokalno.
Korak-po-korak: privremeni analizni pod (slično RunPod-u)
- Pripremite kod kuće: kreirajte radnu kopiju gde ste maskirali matične brojeve, kompletne adrese i nepotrebna imena ako slučaj to dozvoljava. Sačuvajte original lokalno.
- Izaberite Secure Cloud / posvećenu instancu u EU regionu ako postoji i odgovara vam. Izbegavajte Community/deljenog hosta za osetljiv materijal.
- Pokrenite pod sa Linux-imidžom i dovoljno VRAM-a (npr. 16–24 GB za 13B–32B kvantizovano).
- Instalirajte samo ono što vam treba (Ollama ili lokalni web-UI). Preuzmite model u podu.
- Učitajte samo radni tekst (izvode transkripta), ne celu kućnu biblioteku i ne originalni zvuk bez potrebe.
- Izvršite analizu, kopirajte rezultat na svoj sopstveni kriptovani disk.
- Obrišite: uklonite učitane fajlove, zaustavite pod, obrišite eventualne network volumes/snapshots. Ne pretpostavljajte da “zaustavljeno” = “obrisano” ako ste kreirali trajno skladište.
- Isključite API ključeve i ne čuvajte ih u nesigurnim beleškama.
Drugi alternativi u istoj klasi
- Vast.ai, Salad, TensorDock i dr.: slična ideja – iznajmljivanje GPU-a. Integritet varira u zavisnosti od toga da li je mašina community/deljena ili posvećena. Pročitajte uslove i izaberite izolovani kapacitet.
- Sopstveni VPS sa GPU-om u EU: više kontrole ako sami pojačate server, ali više održavanja.
- Nije isto: “privatni mod” u potrošačkim četovima – to je i dalje infrastruktura dobavljača i politika logovanja.
Kontrolna lista pre nego što pošaljete tekst nekoj LLM
- Da li mi uopšte treba AI, ili je dovoljna ručna obrada?
- Mogu li raditi lokalno sa 7B–8B?
- Ako ne: izolovani pod + Secure Cloud + brisanje – ne opšti cloud chat.
- Da li sam maskirao ono što ne mora biti analizirano?
- Da li sam sačuvao rezultat lokalno i očistio učitavanje?
- Da li sam proverio citate prema snimku/dokumentima pre nego što pošaljem mejl instituciji?
Uobičajene greške
- Kopiranje celog dosijea socijalne službe u ChatGPT “samo za testiranje”.
- Poverenje u citate modela bez ponovnog slušanja.
- Ostavljanje network volume sa dosijeom mesecima.
- Korišćenje Community Cloud za osetljiv materijal da bi se uštedelo nekoliko dinara.
- Verovanje da je “lokalni model u oblaku” isto što i offline kod kuće.
FAQ
Da li je RunPod jednako siguran kao sopstveni računar?
Ne. Može biti prihvatljivo kao izolovana privremena obrada ako koristite Secure Cloud i obrišete sve nakon toga. Sopstveno offline pokretanje pruža jaču kontrolu.
Da li moram imati grafičku karticu?
Ne. CPU funkcioniše za 3B–8B, ali sporije. Apple Silicon sa 16 GB često radi dobro bez diskretne GPU.
Koji model treba da počnem?
Kvantizovani 7B–8B model lokalno. Pređite na veći samo ako kvalitet nije dovoljan.
Mogu li koristiti rezultat u prijavi Ombudsmanu?
Da, kao sopstveni radni materijal – ali priložite stvarne citate iz snimaka/dokumenata, ne AI halucinacije.
Povežite sa ostatkom toka
- Snimite sastanak
- Transkribujte sa Whisper lokalno
- Analizirajte sa lokalnim LLM (ovaj vodič)
- Zatražite ispravku / napišite odgovor
- Osnovni vodič: u kontaktu sa vlastima
Za vas koji čitate pod stresom
Vodič je zamišljen kao podrška kada već imate mnogo obaveza. Ne morate sve pročitati odjednom: počnite sa odeljkom koji odgovara vašoj trenutnoj situaciji i vratite se kada sledeći korak postane aktuelan.
Postupci sa vlastima retko se poboljšavaju ako sve nosite sami. Zatražite pomoć od podrške, pravnika ili rođaka ako možete – posebno pre donošenja odluka koje imaju dugoročne posledice.
Uobičajene greške koje otežavaju postupak
- Oslanjanje samo na usmena obećanja bez kratke pisane potvrde ili pratećeg mejla.
- Čekanje sa zahtevom za dokumente dok sukob već nije zaključan – tada je teže pokazati šta je rečeno.
- Pisanje predugih i emotivnih pisama zbog kojih vlast prestaje da odgovara na suštinska pitanja.
- Propuštanje rokova za preispitivanje ili žalbu jer odluka nije pročitana doslovno.
Mini kontrolna lista pre nego što napustite vodič
- Da li imam datum, broj dnevnika/slučaja i ime osobe koja vodi postupak (ako znate)?
- Da li znam koji je sledeći korak: odgovoriti, zatražiti, podsetiti, žaliti se ili prijaviti?
- Da li sam sačuvao mejlove i priloge na mestu gde ih mogu pronaći za nedelju dana?




