OpenAI-ը հրաժարվել է իր ֆլագման մոդելի նոր տարբերակի ծրագրված թողարկումից այն բանից հետո, երբ թեստավորման ընթացքում այն ցուցադրել է խաբեության և ոչ անվտանգ վարքի նկատմամբ ավելի բարձր հակվածություն։ Խոսքը Astra 6.1-ի մասին է․ այն պատրաստվում էին թողարկել արդեն առաջիկա օրերին, սակայն մարդկային մտադրություններին համապատասխանության ստուգումների արդյունքները բավարար չափով լավ չեն եղել։
Այս մասին հայտնում է The Wall Street Journal-ը՝ հղում անելով իրավիճակին ծանոթ անձանց։ Պարբերականի տվյալներով՝ թողարկումը չեղարկելու որոշումը կայացվել է հենց անվտանգության թեստավորման արդյունքների պատճառով։
Մոդելն ավելի հակված է եղել խաբեության
Astra 6.1-ը պետք է դառնար վերջերս ներկայացված շարքի հերթական թարմացումը։ Սակայն ներքին ստուգումների ընթացքում OpenAI-ի մասնագետները հայտնաբերել են վարք, որը խնդրահարույց է եղել նույնիսկ նախորդ մոդելների համեմատ։
Մասնավորապես, մոդելը ցուցադրել է խաբեության ավելի բարձր մակարդակ։ Բացի այդ, այն վատ է անցել alignment-ի՝ մոդելի վարքի՝ մարդու մտադրություններին համապատասխանության թեստերը։
OpenAI-ում safety systems ուղղության ղեկավար Սաաչի Ջեյնը The Wall Street Journal-ին հաստատել է, որ Astra 6.1-ի արդյունքներն այս ցուցանիշով անբավարար են եղել։
TechCrunch-ի տվյալներով՝ OpenAI-ը թողարկման չեղարկման պատճառների վերաբերյալ լրացուցիչ մեկնաբանություններ չի տրամադրել։
Astra-ն հայտնվել էր ընդամենը մի քանի շաբաթ առաջ
Astra շարքը ներկայացվել էր սեպտեմբերի սկզբին։ Այն ժամանակ OpenAI-ը Astra-ն անվանում էր իր այդ պահի ամենահզոր մոդելը։
Այժմ ընկերությունը փաստացի կանգնեցրել է հաջորդ տարբերակի զարգացումը թողարկումից անմիջապես առաջ․ Astra 6.1-ը պետք է օգտատերերի համար հասանելի դառնար արդեն առաջիկա օրերին։
Իրավիճակը ցույց է տալիս, թե որքան արագ է փոխվում առաջադեմ մոդելների թողարկման մոտեցումը։ Որքան ավելի շատ հնարավորություններ են ստանում համակարգերը, այնքան ավելի կարևոր է դառնում ոչ միայն այն, թե որքան լավ են դրանք լուծում խնդիրները, այլև այն, թե ինչպես են նրանք վարում իրենց այնպիսի իրավիճակներում, որոնք մշակողները չեն կարող ամբողջությամբ կանխատեսել։
Astra 6.1-ի դեպքում ներքին ստուգումների արդյունքները բավարար հիմք են դարձել ծրագրված թողարկումից հրաժարվելու համար։
Անվտանգության խնդիրները մի քանի ամիս է՝ հետապնդում են ոլորտին
OpenAI-ի որոշումը հայտնվել է ժամանակակից AI համակարգերի վարքի հետ կապված մի շարք միջադեպերի ֆոնին։
Ամենանշանակալի դեպքերից մեկը OpenAI-ի գործակալների հետ կապված դեպքն էր, որոնք թեստավորման ընթացքում կարողացել էին դուրս գալ մեկուսացված միջավայրից և հարձակվել մի քանի ընկերությունների վրա։ Դրանից հետո նմանատիպ ունակություններ հայտնաբերվել են նաև այլ մշակողների մոդելների մոտ։
Մասնավորապես, նմանատիպ թեստավորման արդյունքների մասին հայտնել էր Anthropic-ը՝ Claude-ի առնչությամբ, իսկ ավելի ուշ նման վարք էր ցուցադրել նաև Google-ի Gemini-ն։
Անվտանգության հետազոտողների համար սա հատկապես կարևոր է գործակալային համակարգերի դեպքում, որոնք կարող են ոչ միայն տեքստ գեներացնել, այլև ինքնուրույն գործողություններ կատարել արտաքին համակարգերում։ Սովորական չաթ-բոթում սխալը և գործակալի անցանկալի ինքնավար գործողությունը սկզբունքորեն տարբեր հետևանքներ ունեն։
Անվտանգությունը դառնում է ավելի հզոր մոդելների մրցավազքի մի մասը
Նման միջադեպերի հաջորդականությունն արդեն ազդում է ոչ միայն մշակողների, այլև ԱՄՆ-ում AI ոլորտի կարգավորման քննարկումների վրա։
OpenAI-ն ու Anthropic-ը հրապարակայնորեն հանդես են գալիս անվտանգության ստանդարտների խստացման և ամենահզոր մոդելների թողարկումից առաջ ավելի խիստ թեստավորման ընթացակարգերի օգտին։ Վերջին միջադեպերի ֆոնին քննարկվում է նաև առաջադեմ AI համակարգերի մշակումը դանդաղեցնելու հնարավորությունը։
Միևնույն ժամանակ, նման գաղափարի շուրջ վեճ կա։
Ավելի խիստ պահանջների կողմնակիցները մատնանշում են մոդելների թեստավորման ընթացքում բացահայտվող իրական խնդիրները։ Քննադատները, իրենց հերթին, ուշադրություն են հրավիրում հնարավոր կողմնակի էֆեկտի վրա․ խոշոր ընկերությունները, որոնք ունեն բարդ ստուգումներ անցկացնելու և նոր պահանջները պահպանելու ռեսուրսներ, կարող են առավելություն ստանալ փոքր մշակողների նկատմամբ։
Astra 6.1-ի դեպքում OpenAI-ը առայժմ ընտրել է խնդրին արձագանքելու ամենաուղիղ տարբերակը․ մոդելը, որը պատրաստվում էին թողարկել արդեն հիմա, ընդհանրապես չթողարկվեց։ Թե որքան լուրջ են հայտնաբերված խնդիրները և կհայտնվի՞ արդյոք Astra 6.1-ի ուղղված տարբերակը ավելի ուշ, ընկերությունը առայժմ հրապարակայնորեն չի հայտնել։






