Прави ли ви впечатление колко бързо вчерашните най-добри и най-скъпи модели се превръщат в нещо сравнително обикновено? Т.е. колко малко време отнема нещо, което днес е frontier capability, да слезе до нормалния workhorse модел. В момента това време изглежда подозрително кратко.
Например Fable 5.1 излезе като top модел, само няколко седмици по-късно Opus 5.5 почти го настигна, а 27 дни по-късно Sonnet 5.5 вече е някъде около него по доста от измерванията.
Може да е особеност на release цикъла им, припокриващи се training pipelines и т.н. Но ето сега OpenAI направиха почти същото: GPT-6 Astra излезе на 3 септември, а 26 дни по-късно, на 29-ти, GPT-6.1 Sol вече е на 52 точки в Artificial Analysis срещу 53 за Astra, при около 4.5 пъти по-ниска цена на задача. При coding резултатите Sol даже минава Astra на някои тестове.
Разбира се, това не означава, че AI напредва едно поколение на всеки месец. Тези модели очевидно не са започнати един след друг, а и benchmarks си имат проблеми.
Epoch пък намират, че цената за фиксирано ниво на capability пада с повече от порядък годишно — около 13 пъти.
Отделно METR измерват нещо съвсем различно — колко дълга задача може един агент да довърши надеждно — и там историческият doubling time е около 7 месеца.
Та май всъщност се случват няколко различни неща едновременно:
- самият frontier се мести осезаемо на всеки няколко месеца;
- agent horizon исторически се удвоява за около 7 месеца;
- цената на едно и също ниво на capability пада с повече от порядък годишно;
- а вчерашният frontier понякога слиза към евтините модели само за няколко седмици.
Последното ми е най-интересно, защото SOTA модел за $50/M tokens може да е впечатляващо demo, но не е за простосмъртни. Същото нещо за $10 или по-малко след месец вече започва да променя какво реално се ползва масово.
Leave a Reply