Ten poradnik ma charakter informacyjny. Zawsze sprawdź, jak przepisy stosują się do Twojej sprawy.
Miejsce w przepływie: po nagraniu i transkrypcji Whisper, jako część W kontakcie z władzami.
div class="bg-amber-50 border-l-4 border-amber-500 p-6 my-8 rounded-r-xl">Krótko mówiąc
- Najlepsza prywatność: uruchom LLM całkowicie lokalnie (Ollama / LM Studio) – tekst nigdy nie opuszcza twojego komputera.
- Druga najlepsza opcja: tymczasowy, izolowany GPU-pod (np. RunPod Secure Cloud), który sam uruchamiasz, ładujesz model, używasz, a następnie usuwasz – nie ChatGPT/Claude-chmura czatowa.
- Unikaj w przypadku wrażliwych spraw: chmury konsumenckie, gdzie wklejasz cały akt do czatu, który trenuje na lub loguje dane wejściowe.
Do czego lokalny LLM jest dobry w sprawach urzędowych
Model językowy (LLM) nie zastępuje porady prawnej. Jest to narzędzie pomocnicze gdy już masz nagranie, transkrypcję lub wymagane dokumenty. Typowe zadania:
- Podsumowanie długiego transkryptu spotkania: decyzje, obietnice, terminy, niejasne punkty.
- Porównaj swoją transkrypcję z notatką służbową urzędu i wypunktuj różnice.
- Zaproponuj strukturę do sprostowania, odpowiedzi lub e-maila z kontynuacją (przepisujesz i sprawdzasz fakty).
- Przetłumacz na swój język, ale zachowaj szwedzkie terminy prawne w nawiasach.
- Znajdź terminy i „co powinienem zażądać na piśmie?” w zawiłym tekście.
Nigdy nie pozwól modelowi „wymyślać” cytatów. Poproś go o zaznaczenie niepewnych części i zawsze sprawdzaj ważne zdania z plikiem dźwiękowym lub oryginalnym dokumentem.
Drabina prywatności: trzy poziomy
- Całkowicie lokalny (zalecany dla dzieci, opieki społecznej, opieki zdrowotnej, migracji, policji): model + czat działają offline na twoim komputerze. Brak przesyłania danych.
- Izolowany GPU, który wynajmujesz na krótko (RunPod Secure Cloud, podobne): dane opuszczają komputer, ale trafiają do poda który kontrolujesz, a nie do ogólnej usługi czatu. Wymaga ścisłej procedury usuwania (patrz poniżej).
- Ogólna chmura AI (ChatGPT, Claude.ai, Gemini i inne): najprostsze – ale wrażliwe dane osobowe powinny być mocno zamaskowane lub w ogóle nie wysyłane. Przeczytaj warunki; załóż, że dane wejściowe mogą być rejestrowane.
Jak uruchomić LLM lokalnie
Alternatywa A: Ollama (Mac, Windows, Linux) – najprostsza dla wielu
- Zainstaluj Ollama z ollama.com.
- Pobierz model, np.
ollama pull llama3.1:8blub szwedzko-/europejsko dostosowany model dostępny w katalogu Ollama, który zmieści się w Twojej pamięci. - Uruchom czat:
ollama run llama3.1:8blub użyj aplikacji/webowego interfejsu Ollama. - Wklej (lub dołącz) kopię roboczą transkrypcji – nie cały plik dźwiękowy.
- Pracuj offline: wyłącz zbędną synchronizację z chmurą dla folderu z wrażliwymi plikami.
Alternatywa B: LM Studio – graficzne i dobre dla początkujących
- Zainstaluj LM Studio.
- Pobierz model GGUF (zacznij od 7B–8B skwantyzowanego, np. Q4/Q5).
- Załaduj model lokalnie. Upewnij się, że wybrano „local server” / offline i nic nie jest wysyłane do chmury.
- Użyj czatu lub lokalnego API (często
localhost) z własnego komputera.
Alternatywa C: GPT4All lub llama.cpp
Działa dobrze na starszych komputerach. Ta sama zasada: pobierz plik modelu raz, uruchom offline, trzymaj wrażliwe teksty poza synchronizacją z chmurą.
Wskazówki działające w sprawach urzędowych
Jesteś asystentem językowym w dziedzinie prawa, nie prawnikiem. Podsumuj tekst w prostym języku polskim. Podziel na: 1) decyzje/komunikaty, 2) obietnice od urzędu, 3) co mam zrobić, 4) terminy, 5) niejasne punkty, które powinienem zażądać na piśmie. Nie zmieniaj cytatów. Oznacz niepewne części jako [niepewne].
Porównaj TEKST A (moja transkrypcja) z TEKSTEM B (notatka urzędu). Wymień tylko konkretne różnice: daty, cytaty, kto co powiedział, brakujące punkty. Nie wymyślaj różnic. Jeśli coś jest niejasne, napisz „nie można ustalić”.
Napisz krótką odpowiedź/projekt sprostowania (maksymalnie 200 słów) na podstawie różnic. Sam sprawdzę każde twierdzenie w źródle przed wysłaniem.
Co komputer musi wykonać
Liczby są zasadami ogólnymi dla kwantyfikowanych modeli (GGUF Q4/Q5). Pełna precyzja wymaga więcej. Język polski i długie transkrypcje wymagają więcej pamięci roboczej (kontekstu) niż krótkie czaty.
| Cel | Rozmiar modelu | Pamięć / GPU | Oczekiwane odczucie |
|---|---|---|---|
| Minimalne podsumowanie | ~3B–4B | 8 GB RAM, brak GPU | Wolne, ale użyteczne na laptopie |
| Dobra codzienna analiza (zalecany tryb startowy) | ~7B–8B Q4/Q5 | 16 GB RAM lub 8 GB VRAM | Akceptowalna prędkość na nowoczesnym laptopie/Mac |
| Długie akty / lepsze rozumowanie | ~13B–14B Q4/Q5 | 32 GB RAM lub 12–16 GB VRAM | Zauważalnie lepsza jakość, cięższe |
| Ciężkie modele / wiele plików | 32B+ lub 70B skwantyzowany | 48 GB+ RAM lub 24 GB+ VRAM | Często lepsze na wynajętym GPU niż na komputerze domowym |
- Apple Silicon (M1/M2/M3/M4): 16 GB zunifikowanej pamięci często wystarcza na 7B–8B. 32 GB daje większy margines dla dłuższych dokumentów.
- Windows/Linux z NVIDIA: Wsparcie CUDA w Ollama/LM Studio zapewnia dużą korzyść prędkości. 8 GB VRAM ≈ wygodnie 7B–8B; 12–16 GB VRAM otwiera 13B.
- Tylko CPU: działa, ale spodziewaj się minut na odpowiedź przy dłuższym tekście. Podziel dokument na sekcje.
- Dysk: licz 4–8 GB na plik modelu; miej 20+ GB wolnego miejsca.
- Whisper + LLM jednocześnie: uruchamiaj je kolejno, aby pamięć wystarczyła.
Jeśli komputer nie daje rady: użyj mniejszego modelu, krótszego fragmentu lub tymczasowej izolowanej GPU (następna sekcja) – nie ogólnego czatu w chmurze z niezamaskowanym aktem.
RunPod i inne izolowane środowiska GPU – czy to bezpieczne dla prywatności?
Krótka odpowiedź: Jest bezpieczniejsze niż wklejanie całego aktu do ChatGPT, ale nie tak bezpieczne jak uruchamianie całkowicie lokalnie. Dane opuszczają twój komputer i są przetwarzane w centrum danych kogoś innego. Dla wielu spraw wystarczy dobrze zarządzana Secure Cloud-pod. Dla chronionych danych osobowych, poważnych spraw zdrowotnych/społecznych lub gdy chcesz maksymalizować kontrolę: pozostań lokalnie lub mocno maskuj.
Co oznacza „izolowana kapsuła” w praktyce
- Wynajmujesz kontener GPU (pod), gdzie ty uruchamia np. Ollama, text-generation-webui lub vLLM.
- Model i twój tekst są uruchamiane w tym kontenerze – nie w udostępnionym czacie konsumenckim z logami milionów użytkowników.
- W RunPod często rozróżnia się Community Cloud (podzielony koszt, tańszy) oraz Secure Cloud (dedykowany/bardziej izolowany sprzęt u dostawcy). Dla materiałów wrażliwych: wybierz Secure Cloud (lub odpowiednią dedykowaną opcję u innego dostawcy).
- Tymczasowy dysk jest często usuwany, gdy pod jest zatrzymywany. Trwała „sieciowa pamięć masowa” pozostaje do momentu ty usuń – nie zapomnij usunąć.
Kiedy RunPod (lub podobne) może być uzasadnione
- Twój komputer nie ma wystarczającej ilości pamięci/GPU dla modelu, którego potrzebujesz.
- Musisz przeanalizować wiele stron w krótkim okresie (7–70B-modeller).
- Możesz postępować zgodnie z poniższą procedurą usuwania i unikać przechowywania więcej niż to konieczne w pode.
Kiedy chcesz zrezygnować z wynajmu GPU
- Chronione dane osobowe, poważne sprawy dotyczące dzieci lub sytuacje, w których nie chcesz, aby materiały opuszczały dom.
- Nie jesteś pewien regionu/przechowywania danych lub chcesz mieć zagwarantowane „zero retention danych” – osiągniesz to przede wszystkim poprzez nieprzesyłanie danych.
- Potrzebujesz tylko prostych podsumowań – w takim przypadku zazwyczaj wystarczy model 7B–8B lokalnie.
Krok po kroku: tymczasowy pod analityczny (podobny do RunPod)
- Przygotuj w domu: utwórz kopię roboczą, w której zamaskujesz numery PESEL, pełne adresy i zbędne nazwiska, jeśli sprawa na to pozwala. Zapisz oryginał lokalnie.
- Wybierz Secure Cloud / dedykowaną instancję w regionie UE, jeśli jest dostępna i odpowiednia dla Ciebie. Unikaj hostingu społecznościowego/współdzielonego dla wrażliwych materiałów.
- Uruchom pod z obrazem Linux i wystarczającą ilością VRAM (np. 16–24 GB dla 13B–32B skwantyzowanego).
- Zainstaluj tylko to, czego potrzebujesz (Ollama lub lokalny interfejs webowy). Pobierz model w podzie.
- Prześlij tylko tekst roboczy (fragmenty transkrypcji), nie całą katalog domowy i nie oryginalne nagrania dźwiękowe bez potrzeby.
- Przeprowadź analizę, skopiuj wynik na własny zaszyfrowany dysk.
- Usuń: usuń przesłane pliki, zatrzymaj pod, usuń ewentualne wolumeny sieciowe/zrzuty. Nie zakładaj, że „zatrzymany” = „usunięty”, jeśli utworzyłeś trwałe przechowywanie.
- Wyłącz klucze API i nie zapisuj ich w niebezpiecznych notatkach.
Inne Alternatywy w tej samej klasie
- Vast.ai, Salad, TensorDock i inne: podobny pomysł – wynajem GPU. Prywatność różni się w zależności od tego, czy maszyna jest wspólnotowa/współdzielona czy dedykowana. Przeczytaj warunki i wybierz izolowaną pojemność.
- Własny VPS z GPU w UE: więcej kontroli, jeśli samodzielnie zabezpieczysz serwer, ale więcej konserwacji.
- To nie to samo: „tryb prywatny” w czatach konsumenckich – to wciąż infrastruktura dostawcy i polityka logowania.
Lista kontrolna przed wysłaniem tekstu do jakiejkolwiek LLM
- Czy potrzebuję w ogóle AI, czy wystarczy ręczne oznaczanie?
- Czy mogę uruchomić lokalnie z 7B–8B?
- Jeśli nie: izolowana kapsuła + Secure Cloud + usunięcie – nie ogólny czat w chmurze.
- Czy zamaskowałem to, co nie musi być analizowane?
- Czy zapisałem wynik lokalnie i usunąłem przesłane dane?
- Czy sprawdziłem cytaty z nagraniem/dokumentem przed wysłaniem e-maila do urzędu?
Typowe błędy
- Wklejanie całego aktu opieki społecznej do ChatGPT „tylko po to, aby przetestować”.
- Zaufanie do cytatów modelu bez ponownego odsłuchania.
- Pozostawienie wolumenu sieciowego z aktem na miesiące.
- Uruchamianie Community Cloud dla wrażliwych materiałów, aby zaoszczędzić kilka koron.
- Przekonanie, że „lokalny model w chmurze” to to samo, co offline w domu.
FAQ
Czy RunPod jest tak samo bezpieczny jak własny komputer?
Nie. Może być akceptowalny jako izolowane tymczasowe obliczenia, jeśli używasz Secure Cloud i usuniesz wszystko później. Własne działanie offline zapewnia silniejszą kontrolę.
Czy muszę mieć kartę graficzną?
Nie. CPU działa dla 3B–8B, ale wolniej. Apple Silicon z 16 GB często działa dobrze bez oddzielnego GPU.
Od jakiego modelu powinienem zacząć?
Lokalny model kwantyzowany 7B–8B. Zmień na wyższy tylko jeśli jakość nie wystarcza.
Czy mogę użyć wyniku w zgłoszeniu do JO?
Tak, jako własny materiał roboczy – ale dołącz rzeczywiste cytaty z nagrania/dokumentów, a nie halucynacje AI.
Połącz z resztą przepływu
- Nagraj spotkanie
- Transkrybuj lokalnie za pomocą Whisper
- Analizuj za pomocą lokalnego LLM (ten przewodnik)
- Zażądaj sprostowania / napisz odpowiedź
- Podstawowy przewodnik: w kontakcie z władzami
Dla tych, którzy czytają w stresie
Przewodnik ma służyć jako wsparcie, gdy masz już wiele na głowie. Nie musisz czytać wszystkiego naraz: zacznij od sekcji, która odpowiada Twojej obecnej sytuacji i wróć, gdy kolejny krok stanie się aktualny.
Sprawy z urzędami rzadko stają się lepsze, gdy wszystko nosisz sam. Poproś o pomoc osobę wspierającą, prawnika lub bliskiego, jeśli możesz – szczególnie przed podjęciem decyzji o długotrwałych skutkach.
Typowe błędy, które utrudniają sprawę
- Poleganie wyłącznie na ustnych obietnicach bez krótkiego pisemnego potwierdzenia lub e-maila z potwierdzeniem.
- Czekanie z żądaniem wydania dokumentów, aż konflikt już się zablokuje – wtedy trudniej jest pokazać, co zostało powiedziane.
- Pisanie tak długie i emocjonalne, że urząd przestaje odpowiadać na meritum sprawy.
- Przegapienie terminów na ponowne rozpatrzenie lub odwołanie, ponieważ decyzja nie została przeczytana dosłownie.
Mini-lista kontrolna przed opuszczeniem przewodnika
- Czy mam datę, numer dziennika/sprawy i nazwisko osoby prowadzącej (jeśli wiesz)?
- Czy wiem, jaki jest następny krok: odpowiedzieć, zażądać wydania, przypomnieć, odwołać się lub zgłosić?
- Czy zapisałem e-maile i załączniki w miejscu, gdzie je znajdę za tydzień?




