Automatisk parsing av ustrukturert data i word/ppt format til strukturert database vha maskinlæring
Godkjenningen dokumenterer en skattefradragsordning, men kilden publiserer ikke faktisk skattefradrag per prosjekt.
Prosjektopplysninger
- Prosjektperiode
- Instrument
- Skatte-/avgiftsfordel
- Støttegiver
- SkatteFUNN / Norges forskningsråd
- Vedtaksdato
- Program/aktivitet
- SkatteFUNN
- Prosjekttype
- SkatteFUNN-prosjekt
- Kommune
- Oslo
- Fylke
- Oslo
Offentlig prosjektsammendrag
Et word, pdf eller powerpointdokument er som regel ustrukturert tekst. I CV Partner har vi et strukturert dataformat som gjør at vi kan behandle CVene or referansene som data. Dvs at vi kan regne på antall års erfaring, finne relasjon mellom kompetanse og prosjekter, eksportere deler av dataen til andre systemer osv. Et struturert dataformat har mye større verdi enn ustrukturerte word og pdf filer. Strukturert data i en søkbar database er en viktig del av vår løsning idag. For å komme igang med CV Partners CV og referanseløsning må hver CV og referanse leses inn manuelt med en egendefinert parser tilpasset hvert format eller mal, evt skrives inn manuelt av hver bruker via webgrensesnittet. Ved å automatisere dette kan vi spare mye tid og frustrasjon hos både nye og eksisterende kunder. FoU utfordringen ligger i å bruke maskinlæring og andre teknologier for å kunne lese inn data i et hvert format uten manuell konfigurering. Mer informasjon på www.cvpartner.no
Kilde og proveniens
SkatteFUNN publiserer prosjektidentitet, periode, eier og godkjenningsstatus uten prosjektbeløp.
Åpne prosjektet i ProsjektbankenMottaker kobles med organisasjonsnummer. Program og prosjektidentitet forblir kildeavgrenset.
Ikke publisert er en egen tilstand og betyr verken null eller ukjent utbetaling.