Një sfidë e re ndërkombëtare për inteligjencën artificiale në fushën e kodimit ka dhënë rezultatet e para — dhe ato kanë surprizuar komunitetin teknologjik. Eduardo Rocha de Andrade, një inxhinier brazilian i komandave (prompt engineer), është fituesi i raundit të parë të çmimit “K Prize”, një konkurs shumëfazësh i nisur nga bashkëthemeluesi i Databricks dhe Perplexity, Andy Konwinski. Andrade fitoi çmimin prej rreth 46,000 euro (€) pasi arriti të përgjigjej saktë në vetëm 7.5% të pyetjeve të testit — një rezultat befasues që nxori në pah kufizimet aktuale të modeleve AI.
Konwinski, i cili e konsideroi këtë një arritje të qëlluar, u shpreh se testet me vlerë duhet të jenë të vështira. Ai theksoi se nëse do të kishin marrë pjesë laboratorët më të mëdhenj me modelet më të avancuara, rezultatet mund të kishin qenë ndryshe. Por pikërisht sepse “K Prize” zhvillohet offline dhe me fuqi të kufizuar kompjuterike, favorizohen modelet e vogla dhe me burim të hapur — një përpjekje për të krijuar kushte të barabarta konkurrimi.
Për dallim nga sistemi ekzistues SWE-Bench, i cili përdor një grup të fiksuar problemesh nga GitHub që modelet mund t’i mësojnë paraprakisht, “K Prize” ofron një qasje “të pastër” duke përdorur vetëm çështje të publikuara pas një date të caktuar dhe me kohë të kufizuar për dërgimin e zgjidhjeve. Kjo shmang stërvitjen specifike mbi benchmark-un dhe i jep testit më shumë vlefshmëri për matjen e kapacitetit real të modeleve.
Aktualisht, SWE-Bench ka rezultate të larta: 75% në testin e thjeshtuar dhe 34% në atë më të vështirin. Kontrasti i thellë me rezultatin 7.5% të “K Prize” ka hapur diskutime nëse kjo diferencë vjen për shkak të “kontaminimit” në SWE-Bench apo nga vetë natyra më e vështirë e përzgjedhjes së problemeve në sfidën e re.
Konwinski ka premtuar një fond prej 920,000 eurosh për modelin e parë me burim të hapur që do të arrijë të kapërcejë 90% të saktësisë në testin e tij. Kjo e bën “K Prize” jo vetëm një mjet vlerësimi, por edhe një sfidë publike ndaj industrisë për të treguar se sa larg jemi nga idetë e shumëpërfolura për “inxhinierët e softuerit të bazuar në AI”.
Ekspertët si Sayash Kapoor nga Universiteti i Princeton theksojnë nevojën për krijimin e standardeve të reja testimi që mund të vërtetojnë aftësinë reale të modeleve. Ai argumenton se, pa eksperimente të tilla, nuk mund të dimë nëse rezultatet pozitive janë të ndikuara nga trajnimi i drejtpërdrejtë mbi benchmark-un apo përfaqësojnë vërtetë aftësi të avancuara.
Në thelb, mes entuziazmit për zhvillimet e reja në AI, Konwinski ofron një paralajmërim të fortë: “Nëse nuk arrijmë as 10% saktësi në një test të pa-kontaminuar, ky është realiteti, jo fantazia për mjekë dhe avokatë të udhëhequr nga AI.”
Përmbledhje:
- Fituesi i sfidës “K Prize” fitoi me vetëm 7.5% të saktësisë, duke treguar kufizimet e tanishme të AI-së në kodim.
- Konkursi sfidon modelet e mëdha duke favorizuar qasjen e burimit të hapur dhe vlerësimin në kushte të barabarta.
- Me 920,000 euro premtuar për modelin e parë që kapërcen 90% saktësi, sfida mbetet e hapur për të gjithë komunitetin zhvillues.
Hashtage:
#InteligjencaArtificiale #KodimAI #KPrize #SfidëTeknologjike #BurimIHapur #Databricks #Perplexity #TestimiAI #EduardoAndrade #BenchmarkAI #Teknologji #ZhvillimSoftuerik #RealitetiAI #IndustriaTech #AI2025