MI Történik?

Mesterséges intelligencia hírek magyarul — naponta frissülve

← Vissza a főoldalra

A Microsoft bemutatta a Phi-4-reasoning-vision-15B nyílt súlyozású multimodális modellt

A Microsoft kiadta a Phi-4-reasoning-vision-15B-t, egy 15 milliárd paraméteres, nyílt súlyozású multimodális modellt, amely a Microsoft Foundry, a HuggingFace és a GitHub felületein keresztül érhető el. A modell kezeli a vizuális-nyelvi feladatokat, beleértve a képaláírásokat, a dokumentumok olvasását és a képernyőelemek beazonosítását, különösen erős a matematika, a tudományos érvelés és a számítógépes interfészek megértése terén. A Microsoft 200 milliárd multimodális tokenen tanította be – ami nagyjából ötször kevesebb, mint a versenytárs modelleké, mint például a Qwen 2.5 VL és a Gemma 3 –, a Phi-4-Reasoning nyelvi modellre építve és a skálázás helyett a gondos adatkezelést (data curation) alkalmazva. Az architektúra közepes fúziót (mid-fusion) alkalmaz egy SigLIP-2 Naflex vizuális kódolóval, amely támogatja a dinamikus felbontást 3 600 tokenig. A Microsoft tanulmányai kimutatták, hogy a dinamikus felbontású kódolók lényegesen felülmúlják a fix felbontású megközelítéseket a nagy felbontású benchmarkokon.

Eredeti forrás megtekintése (angol) →
Kapcsolódó hírek
A DeepSeek látásalapú képességekkel bővítette V4-Flash modelljét
2026. augusztus 29.
Az OpenAI bemutatta a Jalapeño AI-következtető chipjét
2026. augusztus 29.
A rejtélyes Ox Alpha multimodális modell fejtörést okoz a tesztelőknek
2026. augusztus 29.
Tudj meg többet
AI-alapú személyes adatelemzés: A saját digitális nyomaid kiaknázása
A RAG-technológia alapjai: Hogyan tanítsunk saját adatokat az AI-nak?