Հայտնի են ամենաքիչ գրաքննվող նեյրոցանցերը. GPT-5.2-ը ճանաչվել է ամենախիստ գրաքննություն ունեցողը

18 դեկտեմբերի, 2025  20:20

Sansa Bench բենչմարքի մշակողները թարմացրել են նեյրոցանցերի վարկանիշն ըստ գրաքննության մակարդակի, և արդյունքները շատերին են զարմացրել։ OpenAI-ի նոր առաջատար մոդելը՝ GPT-5.2-ը, զբաղեցրել է վերջին տեղը՝ ցուցադրելով հարցումների կատարման մերժումների ամենաբարձր մակարդակը։ Վարկանիշային աղյուսակը գլխավորել է բաց կոդով գործող Llama 3 8B-Instruct-ը։

Ինչպե՞ս է չափվում գրաքննությունը

Sansa Censorship-ը գնահատում է, թե որքան հաճախ է նեյրոցանցը հրաժարվում պատասխանել օգտատերերի հարցումներին՝ սկսած անմեղ թեմաներից մինչև վիճահարույցները։ Որքան բարձր է միավորը (մոտ 1-ին), այնքան քիչ են սահմանափակումները և «ինքնագրաքննությունը»։ Թեստերն ընդգրկում են հազարավոր փրոմփթներ (հրահանգներ), ներառյալ պոտենցիալ զգայուն թեմաներ։

GPT-5.2-ը հավաքել է ընդամենը 0,324 միավոր. սա զգալիորեն ցածր է, քան GPT-4o-Mini-ն (0,765) և Gemini 3 Pro Preview-ն (0,824): Վարկանիշի առաջատարը Llama 3 8B-Instruct-ն է՝ 0,853 միավորով. այն գրեթե երբեք չի մերժում պատասխանները։

Reddit-ի և տարբեր ֆորումների օգտատերերը նկատում են, որ GPT-5.2-ը դարձել է չափազանց զգուշավոր։ Օրինակ՝ այն հրաժարվել է բացատրել, թե ինչ է ինտերնետային խարդախությունը՝ նշելով. «չեմ կարող խրախուսել խարդախ գործողությունները»։

Ինչո՞ւ է OpenAI-ն ուժեղացրել գրաքննությունը

OpenAI-ում պարզաբանում են, որ թարմացումն ուղղված է անվտանգությանը՝ պաշտպանություն փրոմփթ-ինյեկցիաներից և վնասակար հարցումներից։ Մոդելն այժմ ավելի զգայուն է այն թեմաների նկատմամբ, որոնք կարող են վնաս հասցնել, և առաջարկում է դիմել մասնագետների օգնությանը։

Սա ընդհանուր միտում է. խոշոր ընկերությունները (OpenAI, Google, Anthropic) խստացնում են զտիչները (ֆիլտրերը)՝ սկանդալներից և կարգավորող մարմինների հետ կապված խնդիրներից խուսափելու համար։ Մինչդեռ բաց մոդելները, ինչպիսիք են Llama-ն (Meta) կամ Grok-ը (xAI), մնում են ավելի «ազատ»։

Ի՞նչ սպասել հետո. «մեծահասակների ռեժիմ» և վերիֆիկացիա

OpenAI-ն հայտարարել է 2026 թվականի սկզբին ChatGPT-ում «մեծահասակների ռեժիմի» ներդրման մասին, որտեղ ստուգված (վերիֆիկացված) օգտատերերի համար սահմանափակումները կլինեն ավելի քիչ։ Սակայն դեռևս չկա տարիքի հաստատման հուսալի մեթոդ, ուստի գործարկումը կարող է հետաձգվել։

Կարճ ասած

Ըստ Sansa բենչմարքի՝ GPT-5.2-ը 2025 թվականի ամենաշատ գրաքննվող նեյրոցանցն է (0,324 միավոր), իսկ առաջատարը Llama 3 8B-Instruct-ն է (0,853)։ OpenAI-ն ուժեղացրել է ֆիլտրերը հանուն անվտանգության, սակայն օգտատերերը դժգոհում են չափազանց մեծ զգուշավորությունից։ «Մեծահասակների ռեժիմը» խոստանում են 2026-ին, բայց տարիքի ստուգման հարցը դեռ լուծված չէ։ Ազատություն թե՞ անվտանգություն. սա մեծ մոդելների հավերժական երկընտրանքն է։

Հետևեք NEWS.am Tech-ին Facebook-ում և Twitter-ում