ChatGPT Images 2.0 – Jaunais AI modelis, kas pārsteidzoši labi ģenerē tekstu
ChatGPT ieguvis nopietnu jauninājumu – OpenAI ir izlaidis Images 2.0 modeli, kas spēj ģenerēt attēlus ar precīzu tekstu. Kā ziņo TechCrunch, vēl pirms diviem gadiem AI attēlu modeļi nespēja uzrakstīt pat vienkāršu ēdienkarti bez absurdām kļūdām, taču jaunais modelis šo problēmu ir būtiski risinājis.
Kāpēc teksts attēlos agrāk bija tik grūts
AI attēlu ģeneratori vēsturiski cīnījās ar teksta atveidošanu tāpēc, ka lielākā daļa no tiem izmantoja difūzijas modeļus, kuri attēlu rekonstruē no trokšņa. Teksts attēlā aizņem tikai ļoti mazu daļu no pikseļiem, tāpēc modelim nebija pietiekamas motivācijas iemācīties to precīzi atdarināt. Pētnieki ir pētījuši alternatīvas pieejas, piemēram, autoregreīvus modeļus, kas funkcē vairāk kā valodas modeļi un paredz, kādam attēlam vajadzētu izskatīties. OpenAI gan nav atklājis, kāda veida modelis darbina Images 2.0.
Teksta ģenerēšana attēlos
Images 2.0 spēj radīt attēlus ar salasāmu un korektu tekstu – piemēram, pilnvērtīgu restorāna ēdienkarti, ko varētu uzreiz izmantot bez korekcijām. Tas ir krasas izmaiņas salīdzinājumā ar DALL-E 3, kur teksts bieži iznāca sagrozīts vai nesaprotams.
Domāšanas spējas un vairāki attēli no viena uzveduma
Modelim ir “domāšanas spējas” – tas prot meklēt informāciju tīmeklī, no viena uzveduma radīt vairākus attēlus dažādos izmēros un pārbaudīt savus rezultātus. Tas ļauj veidot mārketinga materiālus dažādos formātos un vairākpaneļu komiksu lentes.
Uzlabota daudzvalodu teksta atpazīšana
OpenAI norāda, ka Images 2.0 daudz labāk saprot un atveido tekstu ne-latīņu alfabētos – japāņu, korejiešu, hindi un bengāļu valodās.
Augsta izšķirtspēja un detaļu precizitāte
Modelis spēj atveidot smalkas detaļas – ikonikas, lietotāja saskarnes elementus, blīvas kompozīcijas un subtilus stilistiskus ierobežojumus – līdz pat 2K izšķirtspējai. Tomēr sarežģītu attēlu ģenerēšana aizņem vairāk laika nekā parasta teksta atbilde – komiksa paneļi var prasīt dažas minūtes.
Zināšanu limits un ierobežojumi
Modelim ir zināšanu robeža – 2025. gada decembris –, kas var ietekmēt uzvedumu precizitāti, ja tie saistīti ar jaunākajiem notikumiem pasaulē.
Pieejamība un cenas
Images 2.0 ir pieejams visiem ChatGPT un Codex lietotājiem, taču apmaksātajiem lietotājiem ir pieejami uzlabotāki rezultāti. OpenAI arī atver gpt-image-2 API izstrādātājiem – cenas būs atkarīgas no izvades kvalitātes un izšķirtspējas.
