Digital Trace Data Collection at Scale: Integrating Data Donations in Panel Studies – New Data Spaces | Dialogues

Data donation is emerging as a new tool for survey research. This webinar discusses its potential, limitations, and implementation. presenters: Prof. Dr Florian Keusch (University of Mannheim) & Dr Sebastian Prechsl (IAB); discussant: Dr Caroline Roberts (University of Lausanne); moderator: Dr Rebecca Scheffauer

About the event:

How can digital trace data be integrated into large-scale survey infrastructures? The project “Integrating Data Donation in Survey Infrastructure: Quantifying, Explaining, and Addressing Errors in Representation & Measurement” explores the potential of data donation as a novel approach to collecting behavioural data for social research. By leveraging GDPR provisions that allow users to download their platform data (e.g., from LinkedIn or Instagram), privacy-preserving longitudinal measures can be incorporated into survey research. This webinar introduces the data donation approach, discusses key challenges in integrating donated data into panel studies, and highlights future directions for research.

Why attend?

We invite researchers who want to learn about a new method for collecting digital traces in a survey context and engage in networking opportunities about data collection infrastructures.

More about his event: https://www.new-data-spaces.de/en-us/Start/News-and-Events/New-Data-Spaces-Dialogues/dateId/57826/details/57675/name/data-donation

New Data Spaces | Dialogues is a bi-monthly interactive webinar series hosted by New Data Spaces for the Social Sciences (SPP 2431) that connects researchers, panel study experts, survey methodologists, data users and stakeholders in a shared conversation about the future of social science data.

The series provides a dedicated space to explore methodological innovations, exchange experiences, and discuss how new approaches can be implemented and scaled in practice.

By bringing together perspectives from research and infrastructure development, New Data Spaces | Dialogues aims to foster meaningful dialogue on innovation, implementation, and the evolving landscape of panel and survey research.

BAuA sucht Survey Data Manager:in

An der Bundesanstalt für Arbeitsschutz und Arbeitsmedizin (BAuA) suchen wir eine:n Survey Data Manager:in zur Mitarbeit in unserer Panelbefragung “Studie zur mentalen Gesundheit bei der Arbeit (S-MGA)”. Details findet ihr hier:

https://karriere.baua.de/jobposting/d1c6d937eca5bc88308c15d48ab0f737813b30f20

Wir freuen uns über Bewerbungen bis zum 18.10.2026!

Endlich: Eine Beschreibung der Tabellen des SOEP-Metadatensystems

Eben ist das SOEP Survey Paper »Die Tabellen des SOEP-Metadatensystems« (PDF) erschienen. Diese Dokumentation markiert in mehrfacher Hinsicht einen Meilenstein. Das System von CSV-Tabellen ist immer wieder gewachsen, außerdem wurde die Ordnerstruktur, in der die Tabellen abgelegt werden, mehrfach geändert. Jetzt ist endlich der Status quo beschrieben, von dem aus es zu neuen Ufern gehen kann.

Das erste dieser Ufer ist auch schon in Sicht: Die Dokumentation, die selbst mithilfe agentischer KI entstanden ist, ist auch für agentische KI verständlich. Im begleitenden Repository liegt ein Readme, mit dessen Hilfe ein Agent sich die Dokumentation erschließen kann. Es hat die gleiche Form wie die eigentlichen Metadaten des SOEP. Das System wird also mit sich selbst dokumentiert.

Vielleicht motiviert das ja auch andere Einrichtungen, mehr von ihrer Dokumentation zu veröffentlichen.

Bericht zum KonsortSWD Roundtable Soziodemographie 2026 ist online

Am 10. und 11. Juni 2026 haben sich Datenproduzierende, Datennutzende und Vertreter*innen der Forschungsdateninfrastruktur in den Sozial- und Gesundheitswissenschaften beim „KonsortSWD-Roundtable Soziodemographie 2026: Zwischen Standardisierung und Aktualität“ bei GESIS in Mannheim getroffen. Themen waren insbesondere solche, für die es in den “Demographischen Standards” noch keine Empfehlungen gibt, nämlich Vermögen, Wohneigentumsstatus, Ethnizität und Behinderung/Beeinträchtigung. Für diese Bereiche wäre es denkbar, künftig einen Standard zu entwickeln, auch wenn dies voraussetzungsvoll ist. Auch über das Geschlecht wurde erneut ausführlich diskutiert. Darüber hinaus haben wir in Kleingruppen über Behinderung, Einkommen, Bildung, Migration und Ethnizität sowie über Haushaltstypen und Familienformen gesprochen. Inhalte und Ergebnisse sind nun in einem Bericht veröffentlicht! Auch die Präsentationsfolien sind auf Zenodo verfügbar.

Wer tiefer eintauchen möchte: Schneider, S. L. & Droste, L. (2026). KonsortSWD-Roundtable Soziodemographie 2026: Zwischen Standardisierung und Aktualität – Bericht und Dokumentation. Zenodo. https://doi.org/10.5281/zenodo.21236613

Außerdem haben wir eine Handreichung für Datenproduzierende zur Implementierung der soziodemographischen Standardvariablen, die zur Output-Harmonisierung soziodemographischer Merkmale entwickelt wurden, veröffentlicht. Neben ALLBUS und NEPS ist nun auch das SOEP dabei, wo die Umsetzung im Herbst starten wird! Weitere interessierte Studien können sich jederzeit gerne bei uns melden.

Stille Fehlerquellen in digitalen Surveys – ein Aufruf zur Mitarbeit

Die Abbildung und Einladungstext stammen von Claude AI (Sonnet 4.6). Ich habe den aktuellen Stand des Papers als Kontext gegeben.

Wer einen Fragebogen entwickelt, denkt an Formulierungen, Antwortkategorien, Filterführung. Was dabei oft übersehen wird: Bevor eine einzige Person den Fragebogen ausfüllt, durchläuft das Instrument noch eine weitere kritische Transformation – die technische Implementierung in eine digitale Umgebung. Genau hier können Fehler entstehen, die in den Daten unsichtbar bleiben und dennoch die Messqualität systematisch beeinträchtigen.

Wir arbeiten derzeit an einem Papier, das diese Survey-Programming-Fehler erstmals in einem umfassenden methodischen Rahmen beschreibt. Ausgangspunkt ist die nach wie vor grundlegende Taxonomie von Tarnai und Moore (2004) – die wir jedoch in drei wesentlichen Punkten weiterentwickeln: Erstens erweitern wir den Rahmen auf webbasierte Befragungsumgebungen mit ihren spezifischen Herausforderungen (Geräte- und Browserkompatibilität, komplexe Preloads, Barrierefreiheit). Zweitens ordnen wir Fehlertypen in fünf konzeptuelle Kategorien – Surface Errors, Content Errors, Routing & Logic Errors, Data-Level Errors und System-Level Errors. Drittens führen wir eine sechste Kategorie ein, die bislang in keinem Framework existiert: Specification-Level Errors – Fehler, die nicht in der Programmierung selbst, sondern bereits in der Dokumentation und den Metadaten des Instruments entstehen.

Ein besonderer Fokus liegt auf Längsschnittstudien und Panel-Infrastrukturen, deren kumulierte technische Komplexität (Wellenvariablen, Preloads, Konsistenzanforderungen über Wellen hinweg) eigenständige Fehlerquellen und Qualitätssicherungsanforderungen erzeugt.

Das Papier entsteht aus der Praxis – gespeist durch die Erfahrungen aus großen deutschen Panelstudien bei DJI, DZHW, LIfBi, SOEP und SHARE. Genau deshalb interessiert uns die Perspektive anderer: Wie handhabt ihr die Qualitätssicherung bei der Fragebogenprogrammierung? Welche Fehlertypen begegnen euch immer wieder? Welche Testverfahren haben sich bewährt?

Wir laden Survey-Methodiker:innen, Data-Manager:innen und Programmierer:innen ein, an diesem Papier als Ko-Autor:innen mitzuwirken. Meldet euch gerne direkt bei Knut Wenzig mit einem Github-Namen.

Das nächste Treffen der Arbeitsgruppe „Programmiertestung“ aka “Questionnaire implementation review” (der Text ist auf englisch) findet wieder als Teams-Meeting statt:

  • Montag, 13. Juli, 13 Uhr (jeder 2. Montag im Monat)
  • Teams-Raum

EDDI2026 in Brüssel – Einreichungen bis 1. September möglich

Die diesjährige European DDI Users Conference findet mit Tuorials, Workshops sowie Side Meetings und dem Hackathon der DDI Developers vom 30. November bis 4. Dezember in Brüssel statt.

Einreichungen sind bis 1. September möglich. Der Call for Proposals wurde gerade veröffentlicht.

SLOW-Austauschrunde zu Programmiervorlagen

Im Anschluss an den SLOW 2026 wollen wir eine kleine Projektgruppe gründen, die den Austausch über unsere Programmiervorlagen vertieft.
Der erste Schritt soll sein, sich in 2 Terminen die verschiedenen (Word-)Vorlagen zu zeigen. Dabei können wir schonmal viel über Aufbau und Unterschiedlichkeit lernen. Daran anschließend gibt es die Idee, sich regelmäßig auszutauschen, um das mögliche Entstehen von CSV-Datenbanken oder anderen Formaten miteinander zu diskutieren und zu optimieren.

Die ersten beiden Termine für den Austausch sind
Freitag der 26. Juni, 10-11:30 Uhr
und Freitag der 24. Juli, 10-11:30 Uhr

Die Termine finden bei Webex statt:
https://baua.webex.com/wbxmjs/joinservice/sites/baua/meeting/download/1456794fd8ee4c70aefcb84676129975?MTID=m58d484b2d16d2a6dbd25014d1658e45b
Meeting-Kennnummer (Zugriffscode): 2785 383 8093

Diese Einladung geht an alle interessierten Kolleginnen und Kollegen, wir freuen uns über eine rege Teilnahme!
Bei Fragen oder Wunsch nach Aufnahme in den Verteiler: nold.johanna@baua.bund.de

Austauschtreffen für LimeSurvey Enthusiasten am 21.05.2026

Beim SLOW 2026 in Nürnberg ist bei mehreren Instituten der Wunsch entstanden, den Austausch rund um LimeSurvey stärker zu verstetigen und den „SLOW-Drive“ auch über SLOW hinaus mitzunehmen.

Viele Institute setzen inzwischen regelmäßig auf LimeSurvey, oft mit sehr ähnlichen Herausforderungen, Workarounds und Entwicklungsbedarfen. Gleichzeitig entstehen an vielen Stellen individuelle Lösungen, ohne dass man voneinander weiß oder voneinander profitieren kann. Das würden wir gerne ändern.

LIfBi, DZA FReDA und DeZIM eint aktuell die praktische Arbeit mit LimeSurvey. Deshalb treffen wir uns am 21.05.2026 von 13:30 – 15:30 online und besprechen diese Agenda:

Kurz-Vorträge:

  • Lifbi: Metadatenbasierter Import-Prozess von Surveys über LimeSurvey API
  • DZA: Von csv zu lss und zurück: Metadaten-Konversion für LimeSurvey via Python (Experimentierstatus)
  • FREDA: Übersetzungsprozess mit neu entwickeltem Import- und Export-Tool
  • DeZIM: Prototyp für einen Incentive-Service

Danach diskutieren wir noch über:

  • Macht ein gemeinsamer Austauschkanal Sinn, um unkompliziert Fragen stellen zu können, wenn man bei LimeSurvey nicht weiterkommt?
  • Wo gibt es infrastrukturelle Überschneidungen, bei denen ähnliche Lösungen entwickelt werden? Wie lassen sich Code oder Prozesse teilen, die für ähnliche Problemstellungen universell nutzbar sind?
  • Aufbau eines gemeinsamen Repos? (z. B. für JavaScript-Bibliotheken, Fragetemplates, Designvorlagen, API-Funktionen oder Prozessdokumentationen)?

Teilnehmen: https://teams.microsoft.com/meet/322495850071546?p=kxnA5784ZDhuxDFqLU

Besprechungs-ID: 322 495 850 071 546

Passcode: 3YG6LP7h

Alle LimeSurvey Interessierten sind herzlich eingeladen!

SLOW 2026 in Nürnberg: Drei Tage Werkstatt für Survey‑Praxis, Datenqualität und Zusammenarbeit – Update: Mit Feedback-Galerie!

Der SLO‑Workshop 2026 in Nürnberg war erneut das, was SLOW im Kern ausmacht: ein gemeinsamer Denk‑ und Arbeitsraum für Menschen, die große Surveys verantworten, weiterentwickeln oder kritisch begleiten. Drei Tage lang ging es um sehr konkrete Praxisprobleme – von Rednerlisten über Incentives, Metadaten und Panelpflege bis hin zu KI‑gestützter Kodierung offener Angaben. Vieles davon ist nicht neu, aber selten wird so offen, detailliert und projektübergreifend darüber gesprochen.

 

Moderation, Macht und Rednerlisten

Gleich zu Beginn stand ein Thema auf der Agenda, das auf den ersten Blick wenig „methodisch“ wirkt, aber strukturell zentral ist: quotierte Rednerlisten. Diskutiert wurde weniger das Instrument an sich, sondern die damit verbundenen Hürden. Quotierte Rednerlisten brauchen Moderation, sie machen Ungleichheiten sichtbar und werfen Fragen nach Intersektionalität und der Berücksichtigung nicht‑binärer Personen auf. Gleichzeitig wurde betont, dass Rednerlisten – egal in welcher Form – für viele eine entlastende Struktur darstellen. Einigkeit bestand darin, dass dieses Instrument gesellschaftlichen Sexismus nicht beseitigt, aber ausprobiert werden sollte. Auch und gerade bei SLOW selbst. Bemerkenswert war die klare Benennung der Verantwortung männlich gelesener Teilnehmer, das Thema aktiv einzubringen.

Feldarbeit ohne Pausen, Incentives ohne Bargeld?

Mehrere Sessions drehten sich um praktische Probleme dauerhafter oder hochfrequenter Befragungsfelder. Bei sogenannten „High‑Frequency“-Befragungen gibt es keine natürlichen Feldpausen für Instrumentenüberarbeitungen oder sicherheitsrelevante Updates. Der pragmatische Konsens: kurze, gut kommunizierte Serviceunterbrechungen in Randzeiten sind vertretbar, etwa ergänzt durch Maintenance‑Seiten.

Eng damit verknüpft war die Diskussion um Incentives. Prepaid‑Cash ist wirksam, aber zunehmend problematisch – organisatorisch, international, reputational. Alternativen wie Postpaid‑Cash, Gutscheine, Spendenoptionen oder Punktesysteme werden inzwischen breit eingesetzt und vielfach gut angenommen. Wichtig ist weniger die konkrete Form als Transparenz und zeitnahe Auszahlung. Auffällig war auch, wie selbstverständlich IBANs angegeben werden, wenn der Prozess erklärbar ist.

Panelbereinigung, Attrition und die Frage nach „Kosmetik“

Ein wiederkehrendes Spannungsfeld betrifft den Umgang mit wiederholten Wellenaussetzern. Während diese für engmaschige Längsschnittanalysen kaum nutzbar sind, können sie für Querschnitte oder andere Analyseformen weiterhin relevant sein. Ob man sie im Panel hält, ist weniger eine normative als eine Design‑ und Kostenfrage. Deutlich wurde auch: Kennzahlen wie Attrition und Response Rate sind oft schwer vergleichbar und sollten nicht aus rein kosmetischen Gründen optimiert werden. Hinzu kommen datenschutzrechtliche Überlegungen, etwa die Frage, wie lange ein einmal gegebenes Panel‑Einverständnis tatsächlich trägt.

Preloads, Variablennamen und Harmonisierung

Technischer wurde es bei Preloads, Variablennamen und Harmonisierung. Preloads sind ein wichtiges Mittel zur Verkürzung der Befragungsdauer, bergen aber Risiken: Überfilterung, geringe Fallzahlen und potenzielle Re‑Identifikation. Konsens bestand darin, dass Preloads präzise dokumentiert werden müssen – Herkunft, Bildung, Einsatzorte. Bei Variablennamen blieb die alte Frage offen: sprechend oder systematisch durchnummeriert? Ein Mittelweg zeichnet sich ab, etwa durch zusätzliche Ebenen wie „concept“ oder klare Versionierungen. Besonders sensibel diskutiert wurde die Harmonisierung von Geschlecht, gerade bei kleinen Fallzahlen und im Spannungsfeld zwischen Differenzierung und Datenschutz.

Metadaten als Rückgrat – nicht als Anhängsel

Ein Schwerpunkt des zweiten Tages lag auf Metadaten. Schnell wurde klar, wie schwer eine saubere Abgrenzung zu Paradaten fällt und wie sehr der Nutzen von Metadaten von der jeweiligen Zielstellung abhängt. Dennoch war der Tenor eindeutig: Strukturierte Metadaten sind kein Luxus, sondern Voraussetzung für Qualität, Nachvollziehbarkeit und Automatisierung. Diskutiert wurden einfache, offene Lösungen wie CSV‑basierte Metadatendatenbanken ebenso wie komplexere Systeme. Besonders betont wurde der Vorteil, Fragen, Variablen, Instrumente und Dokumentation systematisch miteinander zu verknüpfen – bis hin zur automatisierten Erstellung von Fragebögen, Codebooks und Methodenberichten.

Kommunikation mit Teilnehmenden: Mails, Papier und Pflege

Serienmails, Panelpflege und Teilnehmerkommunikation zogen sich wie ein roter Faden durch mehrere Sessions. Mail‑Versand ist allgegenwärtig, aber technisch und organisatorisch fragil: Spamfilter, Bounces und intransparente Providerregeln machen das Feld zur Blackbox. Gleichzeitig berichten viele Projekte, dass papierhafte Reminder nach wie vor sehr effektiv sind. Panelpflege wurde nicht als „nice to have“, sondern als eigenständige Aufgabe verstanden: Community‑Gedanke, Ergebnisrückspielung, Portale, Grußkarten, Social Media – alles mit Augenmaß und klarer Zielgruppenorientierung. Besonders sensibel ist die Frage, welche Ergebnisse man an Teilnehmende zurückspielt und wie, ohne zu demotivieren oder Reaktanz auszulösen.

Modi, Technik und Testung

Großen Raum nahmen Mode‑Wechsel ein, insbesondere Push‑to‑Web‑Ansätze. Berichtet wurde von klaren Mode‑Effekten, notwendigen Instrumentenanpassungen und der wachsenden Bedeutung von User Experience, gerade bei längeren Interviews. Parallel dazu wurde über Programmiertestungen gesprochen: Vollständige Tests sind aufwendig, deshalb wurden grafische und modellbasierte Ansätze diskutiert, die technische Prüfungen effizienter machen sollen. Auch hier zeigte sich erneut der Wert strukturierter Metadaten als gemeinsame Grundlage.

KI, offene Angaben und neue Erhebungsformen

Am dritten Tag rückten Innovationen stärker in den Vordergrund. Besonders anschaulich war die Vorstellung der KI‑gestützten Kodierung offener Angaben mit lokalen LLMs. Der Fokus lag weniger auf dem „Wow‑Effekt“ als auf sauberen Prozessen: Kodierschemata, Prompting‑Strategien, Evaluation gegen Goldstandards. Gleichzeitig wurde offen über Grenzen gesprochen – technische Aufwände, Datenschutz, institutionelle Rahmenbedingungen. Ähnlich ambivalent fiel der Blick auf neue Erhebungsformen wie Datenspenden oder CALVI aus: großes Potenzial, aber erhebliche Herausforderungen für Qualität, Vergleichbarkeit und Akzeptanz.

SLOW bleibt Arbeit im besten Sinne

Was SLOW 2026 in Nürnberg ausgezeichnet hat, war weniger ein einzelnes Ergebnis als die gemeinsame Arbeitsweise. Viele Themen blieben bewusst offen, manches widersprüchlich. Aber genau darin liegt die Stärke dieses Formats: Probleme werden nicht glattgezogen, sondern aus unterschiedlichen Perspektiven durchdacht. SLOW bleibt eine Werkstatt – und das Blog bleibt das Lagerfeuer, an dem die Diskussion weitergeht.

Dieser launische Bericht ist das Werk von Copilot, basierend auf einem Google Dokument bei dem viele mitgemacht haben und das viele zusätzliche Details enthält.