Die Dodekaeder-Terrarium-Studie: Dodekaeder-Terrarien und ihre Tücken
Description
Zusammenfassung (Deutsch)
Zur Durchführung dieser Untersuchungen erhielten 40 Bildmodelle denselben Prompt (ein Dodekaeder-Terrarium: Käfer, Humus, Moos, Farn; ein Bild pro Modell, ausgewählt als Best-of-3 – siehe Methodik der Bildgenerierung). Vier unabhängige Bewertungen derselben 40 Bilder wurden verglichen: zwei nicht-blinde Nahsichtungen (Nervli, Mensch; Claude Fable 5, Zoom-Crop-Audit) und zwei blinde Bewertungen (Gemini 3.5 Flash, GPT-5.4). Es wurde eine Konsens-Rangliste über den Mittelwert der Rangplätze erstellt. Podium: gemini-3-pro-image, flux-2-pro, dann ein Dreifach-Patt (gemini-3.1-flash high thinking / mai-image-2.6-preview / flux-2-dev). Zentraler methodischer Befund: Die Bewertungsdistanz – wie nah eine Bewertung ans Bild heranfährt – erklärt die Konflikte besser als die Identität der Bewertenden. Die beiden Nahsichtungen korrelieren stark miteinander (Spearman +0,64), obwohl sie methodisch völlig verschieden arbeiten; die beiden Blind-Bewertungen korrelieren weder mit den Nahsichtungen noch miteinander (−0,30 bis +0,15). Zwei Belege aus entgegengesetzten Richtungen: (1) Ein genauerer Re-Pass von GPT-5.4 auf die acht größten Streitfälle bewegte sechs davon in Richtung der Zoom-Lesart. (2) Flashs Neubewertung komprimierte 38 von 40 Noten auf denselben Wert – die Rangfolge-Information kollabiert (Korrelation mit der menschlichen Bewertung ≈ 0), während Flashs Freitext-Beobachtungen weiterhin echte Bildunterschiede benennen. Da Distanz und Blindheit über die vier Bewertungen hinweg konfundiert sind (keine blinde Nahsicht im Design), trägt der Re-Pass – Distanzvariation bei konstanter Blindheit – die Hauptlast dieses Schlusses. Korollar: Beobachtungen differenzieren, Noten nicht.
Abstract (English)
Forty image models received the same prompt (a dodecahedron terrarium: beetle, humus, moss, fern; one image per model, selected as best-of-3 — see generation methodology). Four independent evaluations of the same 40 images were compared: two non-blind close readings (Nervli, human; Claude Fable 5, zoom-crop audit) and two blind evaluations (Gemini 3.5 Flash, GPT-5.4). Consensus ranking by mean rank position. Podium: gemini-3-pro-image, flux-2-pro, then a three-way tie (gemini-3.1-flash high thinking / mai-image-2.6-preview / flux-2-dev). Central methodological finding: Evaluation distance — how closely an evaluation approaches the image — explains the conflicts better than evaluator identity does. The two close readings correlate strongly with each other (Spearman +0.64) despite using entirely different methods; the two blind evaluations correlate neither with the close readings nor with each other (−0.30 to +0.15). Two pieces of evidence from opposite directions: (1) A closer re-pass by GPT-5.4 on the eight largest disputes moved six of them toward the zoom reading. (2) Flash's re-evaluation compressed 38 of 40 grades onto the same value — rank information collapses (correlation with the human evaluation ≈ 0), while Flash's free-text observations still identify real differences between images. Since distance and blindness are confounded across the four evaluations (no blind close reading in the design), the re-pass — varying distance while holding blindness constant — carries the main weight of this conclusion. Corollary: observations differentiate; grades do not.
Begleitende Website / Companion website: https://terrarium-study-c043c3.gitlab.io
Files
terrarium_studie_de_final.pdf
Files
(2.0 MB)
| Name | Size | Download all |
|---|---|---|
|
md5:a7b3f5e5495af7b2725c35e446b13677
|
1.0 MB | Preview Download |
|
md5:da5a4c76a9845741d7dea159b3cb6b4a
|
996.3 kB | Preview Download |
Additional details
Additional titles
- Translated title (English)
- The Dodecahedron Terrarium Study: Dodecahedron Terrariums and Their Pitfalls
Related works
- Is supplemented by
- Other: https://terrarium-study-c043c3.gitlab.io (URL)