Pensum Group

Pensum Group · internt verktøy

Del regnearket, ikke personene i det.

Last opp en Excel- eller CSV-fil, velg hvordan hver kolonne skal behandles, og last ned en fil med nøyaktig samme struktur — samme faner, kolonner, rader og datatyper — men uten opplysningene som peker på enkeltpersoner.

Ingenting sendes til noen server Tidsserier og kursutvikling kan bevares Samme verdi får samme erstatning overalt

Slipp filene her

.xlsx, .xlsm, .xls, .csv og .tsv. Alle faner i arbeidsboken leses inn, og du kan legge inn flere filer samtidig.

Eksempeldataene er oppdiktede kunde-, beholdnings- og kurstall.

Arbeidsgangen

Fire steg fra original til delbar fil

  1. 01

    Legg inn filen

    Dra den inn eller velg den. Appen leser alle faner og viser dem som egne tabeller.

  2. 02

    Se hva appen har gjettet

    Hver kolonne får en foreslått datatype og innholdskategori. Trykk på en kolonne for å endre den.

  3. 03

    Velg metode per kolonne

    Resultatet vises med én gang i tabellen: original i grått over, ny verdi under.

  4. 04

    Kontroller og last ned

    Gå gjennom kolonnene som er merket med risiko, og last ned filen i samme format.

Grunnlaget

Hva strukturerte data er, og hvorfor det gjør anonymisering mulig

Et regneark er strukturert fordi det følger en fast form: hver rad er én observasjon — én kunde, én transaksjon, én kursnotering. Hver kolonne er ett felt som betyr det samme i alle rader, og som normalt inneholder én datatype: tall, dato, tekst eller ja/nei.

Det er nettopp denne regelmessigheten som gjør at et verktøy kan behandle dataene automatisk. Appen kan si «alt i denne kolonnen er fødselsnumre, bytt dem ut» — noe som er umulig i et løpende dokument der opplysningene ligger spredt i fritekst.

Formen må også overleve behandlingen. Skal filen brukes til analyse, testing eller KI-trening etterpå, må et tall fortsatt være et tall og en dato fortsatt være en dato. Derfor merker appen tydelig de tilfellene der en metode nødvendigvis endrer datatypen — for eksempel når en alder blir til intervallet «40–49», som er tekst.

Anatomien i en tabell
Kundenr Navn Kjøpsdato Markedsverdi
teksttekstdatotall
K-1042Kari Nordmann14.03.2023482 300,00
K-1043Ola Hansen02.05.20231 145 900,00
K-1044Ingrid Vik19.09.202396 750,00

Rad

Én observasjon. Antall rader skal aldri endres av anonymiseringen.

Kolonne

Ett felt med én betydning. Metoden velges her, ikke per celle.

Datatype

Bestemmer hvilke metoder som gir mening for kolonnen.

Det folk oftest bommer på

Å fjerne navnet er sjelden nok

Direkte identifikatorer

Felter som alene peker ut én person: navn, fødselsnummer, e-post, telefon, kontonummer, adresse. Disse må alltid behandles.

Appen markerer slike kolonner med høy risiko hvis de står ubehandlet.

Indirekte identifikatorer

Felter som er harmløse hver for seg, men avslørende i kombinasjon. Postnummer, fødselsår og yrke er nok til å peke ut de fleste. Én kunde med en uvanlig stor beholdning er gjenkjennelig selv uten navn.

Derfor finnes generalisering: grovere verdier gjør at flere rader ligner på hverandre.

Hashing er ikke anonymisering

En hash er en enveis omregning, men når verdiområdet er lite kan alle mulige verdier regnes ut og sammenlignes. Det finnes bare noen millioner gyldige fødselsnumre — med saltet kjent er en slik liste laget på sekunder.

Hashing er pseudonymisering. Bruk pseudonym for personnumre, og hold saltet adskilt fra de anonymiserte filene.

Verktøykassen

De fem metodene

Valget handler om hva du trenger å beholde. Hver metode ofrer noe for å skjule noe annet.

Ansvar og begrensninger

Du er selv ansvarlig for filen du deler

Verktøyet gir ingen garanti for at en behandlet fil er fri for sensitive eller identifiserende opplysninger. Det utfører de valgene du gjør, kolonne for kolonne — det vurderer ikke om valgene er tilstrekkelige for ditt formål.

Kontroller alltid resultatet før filen deles. Vær særlig oppmerksom på:

  • Fritekstfelter kan inneholde navn, diagnoser eller kontonumre midt i en setning. Appen leser ikke innholdet i slike felter.
  • Kombinasjoner av felter kan identifisere en person selv når hvert felt for seg virker uskyldig.
  • Ekstreme verdier — den klart største posten, den eneste i sitt segment — overlever ofte både støy og generalisering.
  • Saltet er nøkkelen. Den som har saltet og et anonymisert datasett kan gjenskape koblinger for verdier som kan gjettes. Del aldri saltet sammen med filene.
  • Formler, farger, pivottabeller og makroer følger ikke med. Filen som lastes ned inneholder rene dataverdier.

Behandling av personopplysninger skal alltid ha et gyldig grunnlag. Er du i tvil om et datasett kan deles eller brukes til et nytt formål, avklar det internt før du sender det videre.

Internt verktøy. All behandling skjer lokalt i nettleseren.

Nøkkelen styrer alle erstatninger. Samme nøkkel gir alltid samme resultat for samme verdi — på tvers av kolonner, faner, filer og dager. Ta vare på den hvis datasett skal kunne kobles senere, og oppbevar den adskilt fra de anonymiserte filene.

Radantall, kolonnenavn, faner og rekkefølge bevares nøyaktig. Tall forblir tall og datoer forblir datoer, med mindre metoden nødvendigvis endrer datatypen — det merkes i så fall med type endres. Du er selv ansvarlig for å kontrollere filen før den deles; verktøyet gir ingen garanti mot gjenværende sensitive opplysninger.