Moderne biodiversiteitswetenschap levert reusachtige hoeveelheden data op. Denk aan DNA-sequenties, foto's van specimens, waarnemingen van soorten en milieumetingen. Maar hoe beheren we al die data verantwoord? En hoe zorgen we dat de data FAIR (vindbaar, toegankelijk, uitwisselbaar en herbruikbaar) is, en integreren we het binnen onderzoeksinfrastructuren?
Het Data Competence Center (DCC) is de centrale kennishub van Naturalis op dit gebied. We ondersteunen onderzoekers en projecten bij het beheren, analyseren en delen van biodiversiteitsdata. Door onze kennis van data-stewardship, bio-informatica en data-architectuur te bundelen, helpen we Naturalis om versnipperde data te veranderen in verbonden, transparante en herbruikbare datastromen.
Dienstenen expertise
Het DCC biedt tools, trainingen en richtlijnen op drie hoofdgebieden. Hiermee ondersteunen we onderzoekers vanaf de allereerste stappen van dataverzameling tot en met de opslag en publicatie voor de lange termijn:
Bio-informatica
Open Science
Data- en systeemarchitectuur
Lees hieronder meer over ons werk en onze expertise binnen elk domein.
Bio-informaticabij het DCC
We ontwikkelen en beheren geautomatiseerde analysesystemen (‘bioinformatics pipelines’) voor de verwerking en kwaliteitscontrole van grote biologische datasets. Dit doen we gestandaardiseerd en reproduceerbaar. Denk hierbij aan technieken zoals DNA-barcoding, metabarcoding, genome skimming en het identificeren van soorten via DNA.
We werken nauw samen met onderzoekers om analyses op maat te ontwerpen. Ook helpen we studenten en startende onderzoekers om vaardig te worden in het werken met data en computergestuurde analyses. Daarnaast regelen we de toegang tot supersnelle computers (HPC) en workflow-systemen - zoals een gedeelde Galaxy-server - en onderhouden we interne tools en diensten voor alle collega's binnen Naturalis.
Open Sciencebij het DCC
We helpen onderzoekers, projecten en infrastructuren om te werken volgens de uitgangspunten van open science. We ontwikkelen metadatamodellen en -beleid, adviseren over datamanagementplannen en passen internationale metadatastandaarden toe. Zo zorgen we dat data wordt gearchiveerd en gepubliceerd volgens de eisen van subsidieverstrekkers en internationale platforms zoals GBIF, ENA en BOLD.
Daarnaast begeleiden we studenten en stagiairs, en organiseren we workshops voor Naturalis-medewerkers over belangrijke open-sciencethema's. Denk aan research datamanagement, herhaalbaar onderzoek en versiebeheer. Zo bouwen we samen aan de kennis, vaardigheden en cultuur binnen Naturalis en onze onderzoeksnetwerken.
Data- en systeemarchitectuurbij het DCC
We modelleren en koppelen datastromen uit verschillende informatiesystemen, ontwikkelen geïntegreerde dataproducten en beheren referentiedatabases. Zo verbinden we data van collecties, taxonomie, laboratoriumonderzoek en moleculaire gegevens met elkaar.
Daarnaast dragen we bij aan internationale standaarden voor biodiversiteitsdata via actieve deelname aan initiatieven zoals DiSSCo, GBIF, TDWG en RDA. We leiden de werkzaamheden van Naturalis op het gebied van FAIR-databeleid voor infrastructuurprojecten. Ook sturen we wereldwijde processen aan rondom digitale sequentie-informatie (DSI) en access and benefit-sharing (ABS).
Wiewerken hier?
Dick Groenenberg, Bioinformaticus
Dominika Kresa, PO, verantwoordelijk voor productvisie, backlog en stakeholder-afstemming
Jeroen Creuwels, Datamanager
Julián López Gordillo, Dataspecialist
Luka Lenaroto, Medewerker bioinformatica
Pierre-Etienne Cholley, Medewerker bioinformatica
Rutger Vos, Afdelingshoofd, geassocieerd lid
Sharif Islam, Data- en systeem architect
Victor Heijke, Data- en systeem architect
Wouter Addink, Coördinator internationale e-infrastructuren en data
Yunhai Yi, Data steward
Partnersen netwerken
Het DCC werkt samen met een breed scala aan nationale en internationale partners om een gezamenlijke infrastructuur voor biodiversiteitsinformatica te ontwikkelen en data, tools en expertise uit te wisselen. Ons netwerk omvat momenteel partners zoals:
GBIF — Global Biodiversity Information Facility
BOLD / iBOL — Barcode of Life Data System, International Barcode of Life Consortium
ENA / INSDC — European Nucleotide Archive / International Nucleotide Sequence Database Collaboration
DiSSCo — Distributed System of Scientific Collections
LifeWatch — European e-Science Infrastructure for Biodiversity
SURF — Dutch national high-performance computing and data infrastructure
NLeSC — Netherlands eScience Center
CoL — Catalogue of Life
TDWG — Biodiversity Information Standards
RDA — Research Data Alliance
OSNL — National Open Science Programme
TDCC NES — Thematic Digital Competence Center for National and Engineering Sciences
TDCC LSH — Thematic Digital Competence Center for Life Sciences and Health