# Evaluación colaborativa de tomate criollo — campañas 2022–2026

**Versión:** 1.0  
**Organización:** Bioleft — semillas abiertas  
**Idioma de los datos:** español  
**Licencia:** Creative Commons Attribution 4.0 International (CC BY 4.0)

## Descripción

Este dataset reúne los datos generados por Bioleft en su programa de evaluación colaborativa de tomates criollos durante cuatro campañas agrícolas desarrolladas en Argentina: 2022–2023, 2023–2024, 2024–2025 y 2025–2026.

El programa busca producir conocimiento distribuido sobre el comportamiento agronómico y las cualidades sensoriales de variedades y accesiones de tomate cultivadas en diferentes condiciones ambientales y de manejo. Los datos fueron generados con la participación de una red descentralizada de evaluadores y evaluadoras, en el marco de procesos de fitomejoramiento participativo, ciencia ciudadana y circulación abierta de semillas.

El depósito contiene 10.313 observaciones agronómicas, 95 participantes anonimizados, 126 registros de sitio por campaña, un vocabulario controlado de 53 materiales varietales y 144 registros agregados de preferencias obtenidos en actividades de degustación pública.

## Estructura de archivos

```text
Bioleft_tomate_dataset_v1.0/
├── README.md
├── observaciones_agronomicas.csv
├── degustacion_publica.csv
├── degustacion_publica_perfil.csv
├── variedades.csv
├── participantes.csv
├── sitios.csv
├── contribuyentes.csv
└── diccionario.csv
```

Todos los archivos tabulares están codificados en UTF-8 y utilizan coma como separador.

### Archivos principales

- **`observaciones_agronomicas.csv`**: observaciones en formato largo, organizadas por campaña, participante, sitio, variedad, etapa y variable.
- **`degustacion_publica.csv`**: resultados agregados de las evaluaciones sensoriales y preferencias.
- **`degustacion_publica_perfil.csv`**: distribución agregada por género y grupo de edad de quienes participaron en las degustaciones.

### Tablas de referencia y documentación

- **`variedades.csv`**: identificadores canónicos, nombres, sinónimos, tipos, roles, procedencia y estado de trazabilidad de los materiales.
- **`participantes.csv`**: identificadores anonimizados, género registrado y campañas de participación.
- **`sitios.csv`**: localización general de los sitios de evaluación y recepción de semillas.
- **`contribuyentes.csv`**: personas, afiliaciones y roles de contribución según la taxonomía CRediT.
- **`diccionario.csv`**: descripción de los campos, tipos de datos, unidades y valores permitidos.

## Observaciones agronómicas

Las observaciones abarcan ocho etapas del ciclo experimental: siembra y emergencia, trasplante a maceta, trasplante a suelo, labores de manejo, crecimiento y desarrollo, labores durante la fructificación, cosecha y poscosecha, y degustación.

La base contiene 123 denominaciones de variables. Su disponibilidad, formulación y nivel de completitud pueden variar entre campañas debido a la evolución de los instrumentos de registro.

## Calidad y comparabilidad entre campañas

- **2025–2026:** planillas individuales consolidadas y depuradas.
- **2024–2025:** base previamente consolidada por el equipo y posteriormente depurada.
- **2023–2024:** reconstruida a partir de 89 planillas individuales; contiene información de 29 evaluadores y presenta niveles desiguales de completitud.
- **2022–2023:** deriva de un archivo consolidado utilizado para el análisis de la campaña; presenta mayor diversidad de accesiones, pero una metodología y un registro menos estandarizados.

Las observaciones de las campañas históricas se identifican mediante el valor `campaña histórica` en el campo `nota`. No debe suponerse que todas las variables son directamente comparables entre campañas. Para análisis longitudinales se recomienda revisar primero `diccionario.csv`, las denominaciones presentes en el campo `variable` y las notas asociadas a cada registro.

Las fechas exactas se expresan en formato ISO 8601 (`AAAA-MM-DD`). Las fechas aproximadas, incompletas o compuestas se conservaron como texto y se señalaron en el campo `nota`. No se imputaron datos geográficos o varietales sin evidencia suficiente; cuando la información no está disponible se utiliza `s/d` o una categoría explícita de variedad no identificada.

## Variedades y procedencia

`variedades.csv` proporciona un identificador canónico para cada material y documenta sus nombres alternativos, tipo, función en el ensayo, procedencia conocida y estado de trazabilidad.

Parte de las accesiones procede de la colección del programa **Al Rescate del Tomate Criollo**, desarrollado por la Facultad de Agronomía de la Universidad de Buenos Aires y el Ministerio de Desarrollo Agrario de la provincia de Buenos Aires. Para algunas accesiones históricas, la procedencia o la cadena de custodia todavía no ha podido verificarse documentalmente. Estas situaciones se explicitan en el campo `estado_trazabilidad` y no deben interpretarse como identificaciones varietales definitivas.

## Degustaciones públicas

Las tablas de degustación contienen resultados agregados de evaluaciones realizadas durante la campaña 2025–2026. En cada actividad se compararon grupos de tomates cherry o redondos respecto de seis atributos: apariencia, aroma, equilibrio entre dulzor y acidez, textura, sabor general e intención de volver a elegir el material.

Para cada variedad y atributo se informa la cantidad de votos que la señaló como mejor o peor y el número de personas que respondió la pregunta. Los tamaños de respuesta pueden variar entre atributos debido a respuestas faltantes. Los datos demográficos se publican exclusivamente de manera agregada.

## Privacidad

El dataset no incluye nombres, direcciones, información de contacto ni otros identificadores personales directos. Los participantes se representan mediante códigos seudonimizados y estables entre campañas.

La correspondencia entre esos códigos y la identidad de las personas se conserva, cuando corresponde, en un archivo confidencial que no forma parte de este depósito. También se revisaron los campos de texto libre para detectar y retirar información personal.

## Usos posibles y limitaciones

El dataset puede utilizarse en investigaciones sobre fitomejoramiento participativo, experimentación agrícola distribuida, semillas abiertas, adaptación varietal, prácticas agroecológicas, participación ciudadana y evaluación sensorial de tomates.

Sus principales limitaciones son la heterogeneidad de los instrumentos entre campañas, la presencia de valores faltantes, la diversidad de formatos en algunos campos y el estado todavía provisional de la trazabilidad de varias accesiones históricas. Estas limitaciones deben considerarse al integrar campañas, comparar variedades o realizar análisis estadísticos.

## Protocolo relacionado

El protocolo metodológico asociado está disponible en protocols.io:

> Cremaschi, A. et al. *Collaborative evaluation protocol for creole tomato varieties*. Version 2. DOI: `10.17504/protocols.io.rm7vzqrq5vx1/v2`.

## Cita sugerida

Cremaschi, A., Bravo, M. L., Chena, F., Schrauf, G., Tachdjian, Y., McKeithen, D. y Red de evaluación participativa Bioleft (2026). *Evaluación colaborativa de tomate criollo — campañas 2022–2026* [dataset, versión 1.0]. Bioleft. Zenodo.

Una vez publicado el depósito, se recomienda utilizar la cita generada por Zenodo, que incorporará el DOI definitivo.

## Licencia

Los datos se publican bajo la licencia **Creative Commons Attribution 4.0 International (CC BY 4.0)**. Se permite reutilizar, adaptar y redistribuir el contenido siempre que se reconozca adecuadamente la autoría del dataset y se indiquen las modificaciones realizadas.
