Bemutatkozik az SWE-2: A Pareto-határ kitolása az AI-mérnökségben
Az SWE-2 kitolja a Pareto-határt, és 50,0%-os eredményt ér el a FrontierCode 1.1 Main1 teszten, miközben 64%-kal olcsóbb. Pontszám és költség tekintetében is veri az SWE-1.7 és a Grok 4.6 modelleket, felveszi a versenyt a GPT-5.6 Sol és a Fable 5/5.1 modellekkel azok árának töredékéért, a GPT-6 Astra eredményeit pedig pár pont különbséggel hozza a költségek negyedéből.
---