Späť na rubriku
Willison

Simon Willison: Pelicanmaxxujú AI laboratóriá? Výskum naprieč 48 kombináciami hovorí: nie

Štvrtok 23. júla 2026 Zdroj: simonwillison.net

Hlavná myšlienka

Dylan Castillo uskutočnil systematický výskum s otázkou: benchmaxxujú AI laboratóriá svoje modely špeciálne na slávny neformálny test s pelikánom na bicykli? Simon Willison experiment komentuje a zdieľa záver: žiadne dôkazy pelicanmaxxingu nenašiel.

Kontext

Simon Willison pravidelne testuje každé nové vydanie LLM jedným promptom: vygeneruj SVG pelikána na bicykli. Tento benchmark sa stal natoľko slávnym, že sa objavila otázka, či ho AI laboratóriá nezačali zámerne optimalizovať (benchmaxxing). Castillo vygeneroval 1 000+ SVG naprieč 7 modelmi a 48 promptmi (8 zvierat × 6 vozidiel).

Prečo to stojí za pozornosť

Výsledok upokojuje, ale samotná existencia tejto otázky naznačuje reálne riziko benchmark gamingu v AI priemysle. Pre výskumníkov a dizajnérov evaluácií ide o pripomienku, že aj neformálne benchmarky sa môžu stať terčom optimalizácie — fenomén s priamym dopadom na dôveryhodnosť AI hodnotení.

Detaily / argumenty

  • Testované modely: 7 frontier modelov
  • Kombinácie: 48 (8 zvierat × 6 vozidiel), každá 3-krát = 1 000+ SVG
  • Záver: žiadne štatisticky významné pelicanmaxxing efekty
  • Pelikány nie sú kreslené lepšie ako iné zvieratá individuálne
  • Kombinácia pelikan+bicykel neprekonáva predikciu z individuálnych skóre
Otvoriť pôvodný zdroj simonwillison.net