Published March 31, 2026 | Version v2

Data from social media: a reflection on the challenges and issues related to access and reuse

  • 1. ROR icon Instituto Brasileiro de Informação em Ciência e Tecnologia
  • 2. ROR icon Universidade de Brasília
  • 3. ROR icon Conselho Nacional de Desenvolvimento Científico e Tecnológico
  • 4. ROR icon Secretaria de Estado de Educação do Distrito Federal

Description

Este dataset é o produto de uma pesquisa exploratória e descritiva sobre os desafios relacionados à coleta, disponibilização e reutilização de dados oriundos de redes sociais no contexto da comunicação científica. O conjunto de dados reúne informações detalhadas sobre 143 conjuntos de dados (datasets) secundários, provenientes de estudos que utilizaram dados de redes sociais e que estão depositados nos repositórios Figshare, Zenodo e Aleia.

Cada entrada do dataset corresponde a um dos datasets analisados e contém os seguintes campos:

  • repositório: nome do repositório onde o dataset original está hospedado (Figshare, Zenodo ou Aleia).
  • dataset: título ou nome do arquivo do conjunto de dados original.
  • ano: ano de publicação ou do período de coleta dos dados.
  • link: DOI ou URL de acesso ao dataset original.
  • descrição: descrição textual do conteúdo do dataset conforme disponível no repositório.
  • coleta: método utilizado para a coleta dos dados (ex.: API, raspagem, coleta manual).
  • acesso aberto: indica se o dataset é publicamente acessível (Sim), se requer cadastro (Acessível a usuários cadastrados) ou se é restrito (Não).
  • anonimizado: indica se os dados foram anonimizados (Sim, Não, Não se aplica, Parcialmente).
  • comentários: observações relevantes sobre a estrutura dos dados, presença de identificadores de usuários, limitações de reuso e outras características identificadas durante a análise.

Metodologia de construção do dataset
Os dados foram coletados por meio de consultas sistemáticas nos repositórios Figshare e Zenodo utilizando o termo “social media data”. Todos os resultados foram avaliados manualmente para selecionar apenas aqueles efetivamente relacionados a dados de redes sociais. Em seguida, foram incluídos também datasets disponíveis no repositório Aleia que atendiam aos mesmos critérios. Para cada dataset identificado, foram extraídas as informações acima, complementadas com a leitura dos artigos científicos associados e a análise das políticas de acesso e dos metadados fornecidos.

Potenciais usos e reuso
Este dataset é uma fonte valiosa para pesquisadores, gestores de repositórios e formuladores de políticas científicas que desejam compreender as práticas atuais de compartilhamento de dados de redes sociais. Ele permite:

  • mapear a diversidade de métodos de coleta (API, raspagem, etc.);
  • identificar barreiras de acesso (dados abertos vs. restritos, necessidade de cadastro);
  • avaliar a adoção de práticas de anonimização e conformidade com os termos de uso das plataformas;
  • subsidiar discussões sobre adesão aos princípios FAIR e CARE no contexto de dados de redes sociais;
  • servir como base para estudos comparativos sobre a evolução do compartilhamento desses dados ao longo do tempo.

Considerações éticas e de acesso
O dataset não contém dados pessoais ou sensíveis, consistindo apenas em metadados de trabalhos científicos já publicados. As informações sobre anonimização e acessibilidade foram extraídas das próprias declarações dos autores originais e das políticas dos repositórios. Recomenda-se que qualquer reutilização deste dataset mantenha a referência à pesquisa original e respeite as licenças dos datasets analisados.

Formato do arquivo
O arquivo é disponibilizado em formato .xlsx (Microsoft Excel), com uma planilha contendo todos os registros. Também está disponível uma versão em .csv para facilitar o processamento em ferramentas de análise de dados.

Abstract (English)

This dataset is the product of an exploratory and descriptive study on the challenges associated with the collection, availability, and reuse of social media data in the context of scientific communication. It compiles detailed information on 143 secondary datasets derived from studies that used social media data and are deposited in the Figshare, Zenodo, and Aleia repositories.

Each entry in the dataset corresponds to one of the analyzed datasets and contains the following fields:

  • repository: Name of the repository where the original dataset is hosted (Figshare, Zenodo, or Aleia).
  • dataset: Title or filename of the original dataset.
  • year: Year of publication or data collection period.
  • link: DOI or access URL of the original dataset.
  • description: Textual description of the dataset’s content as provided in the repository.
  • collection method: Method used to collect the data (e.g., API, scraping, manual collection).
  • open access?: Indicates whether the dataset is publicly accessible (Yes), requires registration (Accessible to registered users), or is restricted (No).
  • anonymized: Indicates whether the data were anonymized (Yes, No, Not applicable, Partially).
  • comments: Relevant observations about data structure, presence of user identifiers, reuse limitations, and other characteristics identified during analysis.

Methodology for building the dataset
Data were collected through systematic searches in the Figshare and Zenodo repositories using the term “social media data”. All results were manually screened to include only those effectively related to social media data. Datasets from the Aleia repository that met the same criteria were then added. For each identified dataset, the information above was extracted, supplemented by reading associated scientific articles and analyzing access policies and metadata.

Potential uses and reuse
This dataset is a valuable resource for researchers, repository managers, and science policy makers seeking to understand current practices in sharing social media data. It enables:

  • mapping the diversity of collection methods (API, scraping, etc.);
  • identifying access barriers (open vs. restricted data, registration requirements);
  • assessing the adoption of anonymization practices and compliance with platform terms of service;
  • supporting discussions on adherence to FAIR and CARE principles in the context of social media data;
  • serving as a basis for comparative studies on the evolution of data sharing practices over time.

Ethical and access considerations
The dataset contains no personal or sensitive data, consisting solely of metadata from already published scientific work. Information on anonymization and accessibility was extracted from the original authors’ own statements and repository policies. Any reuse of this dataset should maintain reference to the original research and respect the licenses of the analyzed datasets.

File format
The file is provided in .xlsx format (Microsoft Excel) with a single worksheet containing all records. A .csv version is also available to facilitate processing in data analysis tools.

Files