Simon Willison: Pelicanmaxxujú AI laboratóriá? Výskum naprieč 48 kombináciami hovorí: nie
Hlavná myšlienka
Dylan Castillo uskutočnil systematický výskum s otázkou: benchmaxxujú AI laboratóriá svoje modely špeciálne na slávny neformálny test s pelikánom na bicykli? Simon Willison experiment komentuje a zdieľa záver: žiadne dôkazy pelicanmaxxingu nenašiel.
Kontext
Simon Willison pravidelne testuje každé nové vydanie LLM jedným promptom: vygeneruj SVG pelikána na bicykli. Tento benchmark sa stal natoľko slávnym, že sa objavila otázka, či ho AI laboratóriá nezačali zámerne optimalizovať (benchmaxxing). Castillo vygeneroval 1 000+ SVG naprieč 7 modelmi a 48 promptmi (8 zvierat × 6 vozidiel).
Prečo to stojí za pozornosť
Výsledok upokojuje, ale samotná existencia tejto otázky naznačuje reálne riziko benchmark gamingu v AI priemysle. Pre výskumníkov a dizajnérov evaluácií ide o pripomienku, že aj neformálne benchmarky sa môžu stať terčom optimalizácie — fenomén s priamym dopadom na dôveryhodnosť AI hodnotení.
Detaily / argumenty
- Testované modely: 7 frontier modelov
- Kombinácie: 48 (8 zvierat × 6 vozidiel), každá 3-krát = 1 000+ SVG
- Záver: žiadne štatisticky významné pelicanmaxxing efekty
- Pelikány nie sú kreslené lepšie ako iné zvieratá individuálne
- Kombinácia pelikan+bicykel neprekonáva predikciu z individuálnych skóre