Published May 15, 2026
| Version 1.1.0
Dataset
Open
UGSC Multilingual Sentiment Dataset for Sustainable Urban Mobility
Authors/Creators
Description
The UGSC-ML dataset is the multilingual version of the User Gold Standard Corpus (UGSC)
for sustainable urban mobility sentiment analysis.
It consists of 375 English transport-related user reviews from TripAdvisor with
sentence-aligned translations in Spanish, French, German, and Italian, yielding
1,875 instances across five languages.
The CardiffNLP XLM-RoBERTa model (`cardiffnlp/twitter-xlm-roberta-base-sentiment`)
is applied in zero-shot domain transfer mode: pre-trained on CC100 and fine-tuned
on Twitter sentiment data, then applied without any task- or domain-specific fine-tuning
to transport reviews.