Ballina TeknologjiGoogle prezanton ‘implicit caching’ për të ulur ndjeshëm kostot e përdorimit të modeleve të saj më të fundit të inteligjencës artificiale

Google prezanton ‘implicit caching’ për të ulur ndjeshëm kostot e përdorimit të modeleve të saj më të fundit të inteligjencës artificiale

by Ailajm
0 komentet

Google ka prezantuar një funksionalitet të ri në API-në e saj Gemini, të quajtur “implicit caching”, që sipas kompanisë, mund të ulë deri në 75% kostot për zhvilluesit që përdorin modelet më të fundit të inteligjencës artificiale. Ky funksion është automatik dhe i aktivizuar paraprakisht për modelet Gemini 2.5 Pro dhe Gemini 2.5 Flash, duke eliminuar nevojën për konfigurime manuale të “prompt”-eve më të përdorura, siç kërkohej më parë me “explicit caching”.

Caching-u në fushën e AI-së përdoret për të kursyer burime përmes ruajtjes së të dhënave që përpunohen shpesh nga modelet, si përgjigjet ndaj pyetjeve të zakonshme. Me funksionin e ri, nëse një kërkesë përmban të njëjtin fillim me ndonjë kërkesë të mëparshme, ajo kualifikohet për një “cache hit”, që sjell automatikisht ulje të kostos.

Kjo lëvizje e Google vjen pasi disa zhvillues u ankuan se modeli paraprak i “explicit caching” krijonte fatura të papritura dhe të larta, sidomos me modelin Gemini 2.5 Pro. Këto ankesa çuan në një kërkim faljeje nga ekipi i Gemini dhe në premtimin për përmirësime konkrete, prej nga lindi edhe “implicit caching”.

Për të përfituar maksimalisht nga ky funksion i ri, Google këshillon që pjesët e përsëritura të kërkesave të vendosen në fillim, ndërsa ato që ndryshojnë nga kërkesa në kërkesë të vendosen në fund. Kjo rrit gjasat për një “cache hit” dhe rrjedhimisht, për ulje të kostos.

Për modelin 2.5 Flash, numri minimal i “prompt token”-eve për të aktivizuar caching-un është 1,024, ndërsa për 2.5 Pro është 2,048 — një sasi relativisht e vogël që e bën këtë funksionalitet të arritshëm edhe për kërkesa të zakonshme. Një mijë “tokens” korrespondojnë afërsisht me 750 fjalë.

Megjithatë, mungesa e një verifikimi të pavarur për kursimet e premtuara nxit një dozë kujdesi tek zhvilluesit. Google nuk ka ofruar prova të jashtme që garantojnë funksionimin e këtij sistemi në praktikë, kështu që mbetet për t’u parë si do të reagojnë përdoruesit e hershëm.

Ky zhvillim është pjesë e një gare të ashpër mes kompanive të mëdha të teknologjisë për të ulur kostot e përdorimit të AI-së për zhvilluesit, në një kohë kur përdorimi i modeleve “frontier” po bëhet gjithnjë e më i shtrenjtë. Google, përmes “implicit caching”, po tenton të mbajë një qëndrim më transparent dhe efikas ndaj komunitetit zhvillues.

Nëse funksionon siç pretendohet, kjo teknologji mund të ndikojë në mënyrën se si kompanitë dhe zhvilluesit ndërveprojnë me AI-në, duke e bërë atë më të përballueshme dhe më të thjeshtë për t’u integruar në produkte reale.

3 Pikat Kryesore:

  • Google pretendon se “implicit caching” mund të kursejë deri në 75% të kostove për kërkesat e përsëritura në API-në e saj Gemini.
  • Funksioni është automatik dhe i aktivizuar nga fillimi, ndryshe nga sistemi manual i mëparshëm.
  • Mbetet për t’u parë nëse përdoruesit do të përjetojnë realisht kursimet e premtuara, pasi mungon verifikimi i pavarur.

Hashtag-e:
#GoogleGemini #InteligjencaArtificiale #Caching #AIdevelopment #TechNews #GeminiAPI #KostoMëTëUlëta #ZhvilluesAI

Ju mund të pëlqeni gjithashtu

Lini një Koment