Über diese Research Engineer – AI Safety-revisjon og red teaming (2-årig stilling) Stelle bei SimulaMet
Centre for AI Security and Safety (CAISS) – AI Safety-avdelingen, SimulaMet
Sted: Oslo | Midlertidig stilling, 2 år, 100 % | Søknadsfrist: 15. oktober. Søknader behandles fortløpende, og vi oppfordrer til å søke tidlig | Tiltredelse: Snarest mulig
Om stillingen
AI Safety-avdelingen ved SimulaMet, som er en del av Simulas Centre for AI Security and Safety (CAISS), søker en Research Engineer i en toårig stilling. Du blir en sentral bidragsyter til SimpleAudit, vårt rammeverk for revisjon og red teaming av KI-systemer. Rammeverket er basert på åpen kildekode og kjører lokalt. Du skal også være med på å gjennomføre reelle sikkerhetsrevisjoner av språkmodeller og KI-systemer for norske partnere i offentlig og privat sektor.
Dette er en praktisk ingeniørrolle i skjæringspunktet mellom programvareutvikling, KI-evaluering og anvendt forskning. Du skal bygge verktøyene og kjøre testene. Du jobber tett med forskere og partnervirksomheter for å gjøre funnene om til noe beslutningstakere kan handle på.
Hvorfor dette er viktig
KI-systemer blir en del av nasjonal infrastruktur, blant annet i helsetjenesten, offentlig forvaltning, forsvaret og utdanningssektoren. Virksomhetene som tar dem i bruk, trenger et svar på et grunnleggende spørsmål: Er dette systemet trygt nok å bruke, på vårt språk, i vår kontekst og innenfor våre regler? For de fleste norske bruksområder finnes det ingen offisiell benchmark. Å sende sensitive prompter til et eksternt API for evaluering er dessuten ofte ikke et alternativ.
Samtidig har det internasjonalt blitt en åpen debatt om hvem som skal evaluere KI-systemer. Mye av verdens evalueringskapasitet ligger enten i selskapene som utvikler de mest avanserte modellene, eller i organisasjoner som har nære bånd til disse selskapene gjennom finansiering og ansatte. Uansett hva man mener om enkelttilfeller, står det strukturelle poenget fast: En evaluering er bare troverdig hvis den som evaluerer er uavhengig av leverandøren som evalueres. Et land kan ikke overlate den vurderingen til andre.
CAISS finnes for å bygge denne uavhengige kapasiteten i Norge, og SimpleAudit er vårt viktigste verktøy for å gjøre det. Verktøyet er basert på åpen kildekode og er anerkjent som et Digital Public Good. Det kjører helt på lokal maskinvare og brukes allerede til å sammenligne modeller for bruk i norsk offentlig sektor. Stillingen handler om å gjøre verktøyet mer kapabelt, mer robust og mer utbredt. Den handler også om å gjennomføre revisjonene som viser hva verktøyet kan.
Om CAISS og AI Safety-avdelingen
CAISS er et samarbeid mellom Simula Research Laboratory og SimulaMet og ble etablert i 2026. Senteret forsker på og evaluerer sikkerheten i KI-modeller og KI-systemer, og er en uavhengig rådgiver for norske myndigheter. Senteret har to spor:
- AI Security handler om tilsiktet skade og fiendtlige trusler og ledes av prof. Leon Moonen ved Simula Research Laboratory.
- AI Safety handler om utilsiktet skade, pålitelighet og robusthet og ledes av prof. Michael A. Riegler ved SimulaMet.
AI Safety-avdelingen utvikler metoder og verktøy for å evaluere hvordan KI-systemer oppfører seg i praksis, med vekt på norsk språk og norske bruksområder. Blant det nyeste arbeidet vårt er SimpleAudit og rapporten State of AI in Norway 2026, som inneholder norskspesifikke tester av 21 språkmodeller. Vi har også publisert metodeartikkelen When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels. Vi samarbeider tett med partnere, blant annet Helsedirektoratet.
Arbeidsoppgaver
- Videreutvikle SimpleAudit. Du skal utforme og implementere ny funksjonalitet og forbedre arkitektur og ytelse. Du skal utvide støtten for modeller og backends, både lokale open-weight models og API-baserte modeller. Du skal også holde kodebasen vedlikeholdbar, testet og godt dokumentert.
- Utvikle og vedlikeholde testinnhold. Du skal lage nye revisjonsscenarioer og «pakker», for eksempel for sikkerhet, helse, RAG og agentisk atferd. Scenarioer på norsk og i norsk kontekst er særlig viktige.
- Gjennomføre revisjoner. Du skal planlegge og gjennomføre sikkerhetsevalueringer av språkmodeller og KI-systemer for CAISS-prosjekter og partnervirksomheter. Arbeidet går fra oppsett via analyse til rapportering.
- Støtte åpen kildekode-miljøet. Du skal følge opp saker (issues) og bidrag og skrive dokumentasjon og veiledninger. Du skal også hjelpe partnere som kommuner, sykehus og etater med å ta verktøyet i bruk i egne miljøer.
- Bidra til forskning. Du skal jobbe med forskerteamet om metodikk og bidra til rapporter og publikasjoner. Du skal også presentere arbeidet for partnere og på arrangementer.
- Drifte beregningsressurser og infrastruktur. Du skal sette opp og vedlikeholde den lokale GPU- og inferensinfrastrukturen som trengs for å kjøre revisjoner uten at data forlater et sikkert miljø.
Hvem vi ser etter
Krav
- Mastergrad i informatikk, maskinlæring eller et beslektet fagfelt, eller tilsvarende erfaring. Doktorgrad er velkommen, men ikke et krav.
- Gode ferdigheter i Python og solid praksis innen programvareutvikling, blant annet version control, testing, code review, packaging, documentation.
- Praktisk erfaring med store språkmodeller (LLM-er). Det kan være erfaring med å kjøre open-weight models lokalt, for eksempel via Hugging Face, vLLM, Ollama eller lignende, og/eller med å utvikle mot LLM-API-er.
- Evne til å jobbe selvstendig, strukturere eget arbeid og levere pålitelige resultater i et lite team.
- Gode muntlige og skriftlige ferdigheter i engelsk.
- Flytende norsk eller et annet skandinavisk språk. Mye av testinnholdet, partnerdialogen og rapporteringen foregår på norsk, og det er sentralt i arbeidet å forstå hvordan en modell oppfører seg på norsk.
- Gode kommunikasjonsevner og samarbeidsevner.
Det er en fordel med
- Erfaring med KI-evaluering, red teaming, benchmarking eller adversarial testing.
- Kjennskap til agentiske systemer, RAG-løsninger eller LLM-er som bruker verktøy.
- Erfaring med å vedlikeholde eller bidra til åpen kildekode-prosjekter.
- Kunnskap om norsk offentlig sektor, helsesektoren eller regelverket for KI, for eksempel EUs KI-forordning (AI Act).
- Erfaring med GPU-infrastruktur, containerisering og utrulling.
Vi setter pris på nysgjerrighet, nøyaktighet og en genuin interesse for å gjøre KI-systemer tryggere i praksis. Vi oppfordrer deg til å søke selv om du bare oppfyller de fleste og ikke alle kriteriene.
Vi tilbyr
- En sentral rolle i å bygge Norges uavhengige kapasitet for KI-evaluering og å bidra til Europas. Du jobber med et verktøy som allerede er i bruk og i vekst.
- Et ambisiøst team med kort vei til beslutningstakere og partnere i offentlig og privat sektor.
- Frihet til å forme den tekniske retningen for et åpen kildekode-prosjekt og mulighet til å være medforfatter på rapporter og publikasjoner.
- Tilgang til moderne infrastruktur.
- Konkurransedyktig lønn etter Simulas lønnsskala, gode pensjons- og forsikringsordninger og et fleksibelt og inkluderende arbeidsmiljø sentralt i Oslo.
- Hjelp med flytting for internasjonale kandidater.
Søknad
Send inn følgende via rekrutteringsportalen vår:
- CV
- Et kort søknadsbrev på maks én side, der du forklarer hvorfor du er interessert i stillingen og hvordan bakgrunnen din passer
- Lenker til relevant kode, for eksempel på GitHub, og eventuelt publikasjoner
- Karakterutskrifter og vitnemål
- Kontaktinformasjon til to referanser
Fortløpende behandling. Vi ønsker å besette stillingen raskt. Søknadene vurderes fortløpende etter hvert som de kommer inn, og vi holder intervjuer underveis. Utlysningen kan bli avsluttet før fristen dersom vi finner en egnet kandidat, så vi oppfordrer deg sterkt til å søke tidlig. Kan du tiltre på kort varsel, ber vi deg nevne det i søknadsbrevet.
Intervjuene kan inneholde en praktisk, teknisk oppgave.
Simula verdsetter mangfold og ønsker søkere velkommen fra alle kvalifiserte kandidater, uavhengig av kjønn, bakgrunn eller funksjonsnedsettelse.
Kontakt: Prof. Michael A. Riegler, leder for AI Safety-avdelingen, SimulaMet – [email protected] | Seniorrådgiver HR Fanny Klang – [email protected]
Ansettelse i denne stillingen skjer i henhold til sikkerhetsloven og lov om kontroll med eksport av strategiske varer, tjenester og teknologi m.v. (eksportkontrolloven). Søkere som etter vurdering av søknaden og vedlegg anses å være i konflikt med dette regelverket, vil ikke være kvalifisert for stillingen. Vurderingen tar også hensyn til om forskningsområdet omfatter sensitive teknologier, flerbruksteknologi, kritisk infrastruktur eller andre sikkerhetsrelevante temaer.
SimulaMet benytter bakgrunnssjekk i rekrutteringsprosessen. I henhold til offentleglova kan opplysninger om søkeren bli ført opp i offentlig søkerliste, også dersom søkeren har bedt om ikke å bli ført opp.
Les mer: simula.no/caiss · SimpleAudit på GitHub