ટૂંકો જવાબ: CLM-8B એ એક ખુલ્લું કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ જેનો હેતુ ઝડપી એજન્ટ નિર્ણયો લેવાનો છે, જેમાં લેખક Jev-ક્લાસ પીઅર્સ કરતા લગભગ 9× ઓછી લેટન્સીના દાવા કરે છે. તે આંકડા રિલીઝ સેટઅપની બહાર અપ્રમાણિત રહે છે. જો તમે કોડિંગ એજન્ટો બનાવો છો, તો ચાર્ટ પર વિશ્વાસ કરતા પહેલા તેને તમારા પોતાના હાર્નેસ પર A/B કરો.
મુખ્ય બાબતો:
લેટન્સીના દાવાઓ: ~9× Jev સ્પીડઅપને લેખક દ્વારા અહેવાલ મુજબ ગણો જ્યાં સુધી અન્ય લોકો તેને ફરીથી ઉત્પન્ન ન કરે.
ઇવલ હાર્નેસ: A/B પરીક્ષણ CLM-8B કરતી વખતે ટૂલ્સ અને પ્રોમ્પ્ટ્સને ઠીક કરીને પકડી રાખો.
હાઇબ્રિડ સ્ટેક: હોટ લૂપ્સ માટે CLM નો ઉપયોગ કરો; નવા કાર્યો માટે ધીમા રીઝનર રાખો.
ઓપન વેઇટ: કોમર્શિયલ ફોર્ક મોકલતા પહેલા અપાચે લાઇસન્સ ફાઇલોની પુષ્ટિ કરો.
દુરુપયોગનું જોખમ: એજન્ટો મિલિસેકન્ડમાં નિર્ણય લે ત્યારે ગેટ રિવર્સિબલ ટૂલ્સ અને રહસ્યો.
CLM-8B શું બનવાનો પ્રયાસ કરી રહ્યું છે ⚡
આ ઘટાડાને પ્રોત્સાહન આપતા લોકો દ્વારા વર્ણવ્યા મુજબ, વિરોધાભાસી ભાષા મોડેલ તાલીમ, એકલતામાં આગામી-ટોકન સંભાવનાને મહત્તમ કરવાને બદલે રાજ્યો અને ક્રિયાઓને જોડવા વિશે છે. સ્પષ્ટ શબ્દોમાં કહીએ તો: મોડેલને "અહીં પરિસ્થિતિ છે" ને "અહીં ચાલ છે" નો નકશો બનાવવા માટે દબાણ કરવામાં આવે છે, જે નવલકથાકાર કરતાં નીતિ વડાની જેમ વધુ છે. સિસ્ટમ 1 ની સમાનતા સંશોધકો ઝડપી, સહયોગી, નિર્ણય-આકારના - સુધી પહોંચતા રહે છે, જે સિસ્ટમ 2 ની લાંબી સાંકળ-ઓફ-થટ ટેનરથી વિપરીત છે જે મોટેથી વિચારતી વખતે ટોકન્સને બાળી નાખે છે.
CLM-8B એ તે લાઇનમાં પહેલું પબ્લિક વેઇટ સેટ છે. તે ડ્રોપ સાથેના કવરેજ પર Apache 2.0 લાઇસન્સ સાથે ઓપન રિસર્ચ રિલીઝ તરીકે સ્થિત છે, જે જો તમે વકીલ પિકનિક વિના ફાઇન-ટ્યુન, શિપ અથવા ફોર્ક કરવા માંગતા હો તો મહત્વપૂર્ણ છે. જેકી ક્વોકે કાર્ય રજૂ કર્યું ; સ્ટેનફોર્ડ-સંકળાયેલ અઝાલિયા મિર્હોસેનીએ તેને વિસ્તૃત કર્યું; અને વ્યાપક ફ્રેમિંગ સ્ટેનફોર્ડ અને NVIDIA-લિંક્ડ ટીમ પ્રયાસને ચિત્રિત કરે છે. નામાંકિત સંશોધકો, પબ્લિક વેઇટ, ઓપન કોડ - કોઈ અનામી લીક નથી. તૃતીય-પક્ષ પ્રતિકૃતિ માટે હજુ પણ વહેલું છે, તેથી શંકાસ્પદતા ડાયલને "રસપ્રદ" અને "મને સ્વતંત્ર બોર્ડ બતાવો" વચ્ચે ક્યાંક રાખો.
કદ વર્ગ આઠ અબજ પરિમાણોનો છે, જે એટલો નાનો છે કે લેબ્સ અને ઇન્ડી બિલ્ડરો H100 સમય માટે કિડની વેચ્યા વિના તેને હોસ્ટ કરી શકે છે. પહેલાથી જ મોટા CLM-35B ફોલો-ઓનની ચર્ચા થઈ રહી છે. તે મોટો ભાઈ લેટન્સી સ્ટોરી જાળવી રાખે છે કે ડેપ્થ માટે સ્પીડનો વેપાર કરે છે તે હજુ પણ અનિશ્ચિત છે, પરંતુ રોડમેપ સંકેત સ્પષ્ટ છે: આ એક પરિવાર માટે છે, એક વખતનું ડેમો કાર્ડ નહીં.
- ધ્યાન કેન્દ્રિત કરો: સ્થિતિ → એજન્ટો માટે ક્રિયા લૂપ્સ, નિબંધ લેખન માટે નહીં
- રિલીઝની આસપાસ કવરેજમાં લાઇસન્સિંગને અપાચે 2.0 તરીકે ફ્રેમ કરવામાં આવ્યું હતું
- શૈલી: સિસ્ટમ ૧ / નિર્ણય-લક્ષી તાલીમ વાર્તા
- ફોલો-ઓન: મોટા CLM-35B નો યોજના તરીકે ઉલ્લેખ કરવામાં આવ્યો છે
સિસ્ટમ ૧ સ્ટાઇલ વિરુદ્ધ સામાન્ય ટોકન ટ્રેડમિલ
મોટાભાગના પ્રોડક્શન LLMs જે તમે જાણો છો તે એક સમયે એક ટોકન ટેક્સ્ટ જનરેટ કરે છે. તે ગદ્ય, કોડ ડમ્પ અને કાળજીપૂર્વક તર્કના ટ્રેસ માટે ખૂબ સારું કામ કરે છે. આ જ કારણ છે કે જે એજન્ટને પ્રતિ મિનિટ વીસ સૂક્ષ્મ-નિર્ણયોની જરૂર હોય છે તે મોડેલ "સ્માર્ટ" હોવા છતાં પણ સુસ્તી અનુભવી શકે છે. દરેક પગલું ઓટોરેગ્રેસિવ ટેક્સ ચૂકવે છે.
કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ પિચ ભારને ઉલટાવી દે છે. નેટવર્કને જવાબમાં તેનો માર્ગ વર્ણવવા માટે કહેવાને બદલે, તમે તેને યોગ્ય સ્થિતિને પ્રાધાન્ય આપવા માટે તાલીમ આપો છો - સારી અને ખરાબ ચાલ વચ્ચે વિરોધાભાસી ખેંચાણ વિચારો, ફક્ત અસ્ખલિત ચાલુતા જ નહીં. બિલ્ડરો પહેલાથી જ પેટર્ન જાણે છે: કેટલીકવાર તમારે હજાર શબ્દોના તર્કની જરૂર નથી; તમારે મોડેલમાં rm -rf ને બદલે pytest ટાઇપ કરવાની જરૂર છે . ફાસ્ટ લૂપ્સ તે તફાવતની કાળજી રાખે છે.
આનો કોઈ અર્થ એ નથી કે CLM-8B ટેક્સ્ટ ઉત્સર્જન કરી શકતું નથી. તેનો અર્થ એ છે કે તાલીમ ઉદ્દેશ્ય અને મૂલ્યાંકન વાર્તા એજન્ટિક નિયંત્રણ તરફ ઢળેલી છે. તે "ચેટ મોડેલ જે ટૂલ-કોલ પણ કરી શકે છે" કરતાં અલગ ઉત્પાદન સ્વરૂપ છે. ઉદ્યોગે વર્ષોથી મોડેલ્સને ટૂલ્સ વિશે વાત કરવામાં વધુ સારી બનાવવામાં વિતાવ્યા છે જ્યારે હજુ પણ વાતમાં જ અવરોધ ઉભો કરે છે. નિર્ણય-પ્રથમ મોડેલ એ એક પ્રકારનું સાઇડવેઝ મૂવ છે જે કાં તો પાછળની દૃષ્ટિએ સ્પષ્ટ દેખાય છે અથવા જ્યારે બેન્ચમાર્ક ગૂંચવાઈ જાય છે ત્યારે નિષ્ફળ જાય છે. બંને પરિણામો શક્ય છે.
દાવો કરેલ ગતિ અને બેન્ચ નંબરો (દાવા તરીકે ગણો)
અહીં તે ભાગ છે જે સામાજિક પોસ્ટ્સને ચલાવે છે: પ્રમોટર્સ Jev-ક્લાસ મોડેલો કરતાં લગભગ 9x ઝડપી અનુમાનનો. હળવા ફાઇન-ટ્યુનિંગ પછી, તેઓ મજબૂત એજન્ટિક કોડિંગ પરિણામો પણ જણાવે છે - DeepSWE લગભગ 81.6% સફળતા અને ટર્મિનલ-બેન્ચ 2.1 લગભગ 87.6%. કેટલાક મૂલ્યાંકન પર તેઓ શૂન્ય-શોટ પ્રદર્શનને Jev સાથે તુલનાત્મક તરીકે વર્ણવે છે જ્યારે લેટન્સી ઘણી ઓછી રહે છે. રિલીઝ ચેટર સાથે તરતા એક ક્લસ્ટર સારાંશમાં ટર્મિનલ બેન્ચ સેટિંગ પર આશરે 32 ms-ક્લાસ પ્રતિભાવ સમયનો ઉલ્લેખ કરવામાં આવ્યો છે. વાક્ય જે કાળજીપૂર્વક: અહેવાલ અને દાવો કરવામાં આવ્યો છે, આ લેખમાં સ્વતંત્ર રીતે ઓડિટ કરવામાં આવ્યો નથી.
જો તે લેટન્સી આંકડા સામાન્યીકરણ કરે, તો વ્યવહારિક જીત પ્રતિ સમવર્તી એજન્ટ ઓછા GPU અથવા પ્રતિ GPU વધુ એજન્ટો છે. કોડિંગ એજન્ટો જે શેલને થ્રેશ કરે છે તે ખાસ કરીને સંવેદનશીલ હોય છે કારણ કે વોલ-ક્લોક વેઇટિંગ સ્ટેક્સ; 200 ms નિર્ણય અને 30 ms નિર્ણય થોડા સો વળાંક પછી અલગ અલગ ઉત્પાદનો જેવા લાગે છે. જ્યારે તીવ્ર પીડા ઇન્ટરેક્ટિવ લેગ હોય છે ત્યારે વપરાશકર્તાઓ ઘણીવાર "મોડેલ મૂર્ખ હોવા" માટે દોષ આપે છે.
છતાં - અને આ પુખ્ત દેખરેખ ફકરો છે - લેખક બેન્ચ માર્કેટિંગ કરી રહ્યા છે જ્યાં સુધી કોઈ અન્ય તેમને શેર કરેલા હાર્ડવેર પર શેર કરેલા પ્રોમ્પ્ટ સાથે પુનઃઉત્પાદિત ન કરે. હળવા ફાઇન-ટ્યુનિંગ પરિણામો પણ ઘણી બધી સ્કેફોલ્ડિંગ છુપાવી શકે છે. મજબૂત DeepSWE અને ટર્મિનલ-બેન્ચ નંબરો ચોક્કસપણે ઉત્તેજક છે કારણ કે તે સ્યુટ્સ બરડ એજન્ટોને સજા કરે છે, પરંતુ ઉત્તેજના પ્રતિકૃતિ નથી. 9× અને તે 32 ms-ક્લાસ આકૃતિ પર CLAIM લખેલી સ્ટીકી નોંધ રાખો.
સરખામણી કોષ્ટક: ટોકન-બાય-ટોકન LLMs વિ CLM-સ્ટાઇલ ફ્રેમિંગ
જ્યારે માર્કેટિંગ ભાષા લપસણી થઈ જાય છે ત્યારે કોષ્ટકો મદદ કરે છે. આ કોષ્ટક લાક્ષણિક LLM જનરેશન ટેવોની તુલના સંશોધકો દ્વારા વર્ણવેલ કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ વાર્તા સાથે કરે છે. કોષો હેતુપૂર્વક થોડા અસમાન હોય છે કારણ કે ચોક્કસ સરખામણી હંમેશા હોય છે.
| કોણ | લાક્ષણિક LLM (ટોકન-બાય-ટોકન) | CLM-શૈલી / સિસ્ટમ 1 ફ્રેમિંગ | એજન્ટો માટે તે શા માટે મહત્વનું છે |
|---|---|---|---|
| પ્રાથમિક લૂપ | આગામી ટોકનનું અનુમાન કરો, ઘણીવાર લાંબા ટ્રેસ સાથે | નકશાની સ્થિતિથી ક્રિયા; વિરોધાભાસી નિર્ણય પૂર્વગ્રહ | ટૂલ કોલ્સ વચ્ચે ઓછા વેડફાયેલા ટોકન્સ (સિદ્ધાંતમાં) |
| વિલંબની લાગણી | બહુ-પગલાંના નિયંત્રણ હેઠળ વાત-ચીત ધીમી લાગે છે | લેખકો દાવો કરે છે કે Jev-ક્લાસની તુલનામાં લેટન્સી ઘણી ઓછી છે | ઇન્ટરેક્ટિવ કોડિંગ એજન્ટો રાહ જોવાનો સમય પસંદ કરતા નથી |
| સ્ટ્રેન્થ ઝોન | ગદ્ય, આયોજન નિબંધો, વ્યાપક વાતચીત | ઝડપી સ્થિતિ→ક્રિયા - એજન્ટિક કોડિંગ પ્રકાશિત | અલગ નોકરી, હંમેશા રિપ્લેસમેન્ટ નહીં |
| રિપોર્ટ કરેલા નંબરો | મોડેલ પર આધાર રાખે છે; અહીં કોઈ એક આકૃતિ નથી | ~9× સુધી ઝડપી (દાવો); DeepSWE ~81.6%; ટર્મિનલ-બેન્ચ 2.1 ~87.6% હળવા FT પછી (દાવા) | જો તૃતીય પક્ષો પુષ્ટિ કરે તો વચન આપવું - જો મોટું હોય તો |
| નિખાલસતા | બંધ API અને ખુલ્લા વજનનું મિશ્રણ | અપાચે 2.0 હેઠળ ફ્રેમ કરેલ વજન/કોડ ખોલો | શબ્દોનો અંદાજ લગાવ્યા વિના તમારી જાતને ફાઇન-ટ્યુન કરો અને હોસ્ટ કરો |
| પકડો / મજાક કરો | સ્માર્ટ પણ ક્યારેક કાયમ માટે વાત કરે છે 🐢 | હજુ વહેલું છે; સ્વતંત્ર પુનઃપ્રસારણ બાકી છે | એક જ પ્રેસ ચાર્ટ પર કંપની પર દાવ ન લગાવો |
ટેબલનો ઉપયોગ માનસિક મોડેલ તરીકે કરો, ચુકાદા તરીકે નહીં. પ્રોડક્ટ ટીમોએ હજુ પણ પોતાના હાર્નેસને માપવાની જરૂર છે: ટૂલ સ્કીમા, પુનઃપ્રયાસ નીતિ અને પર્યાવરણીય અવાજ સ્લાઇડ ડેક સ્વીકારે છે તેના કરતાં વધુ સ્કોર્સને ખસેડશે.
આ ઘોંઘાટ પાછળ કોણ છે 👤
એટ્રિબ્યુશન મહત્વપૂર્ણ છે કારણ કે ઓપન AI ડ્રોપ્સમાં સાવચેતીભર્યા લેબ રિલીઝથી લઈને રહસ્યમય ટોરેન્ટનો સમાવેશ થાય છે. આમાં ચહેરાઓ છે. જેકી ક્વોકે CLM રજૂ કર્યું; અઝાલિયા મિર્હોસેનીએ તેને વ્યાપક દૃષ્ટિકોણમાં આગળ વધારવામાં મદદ કરી; કવરેજ સતત સ્ટેનફોર્ડ અને NVIDIA-સંકળાયેલ સંશોધન સહયોગને ફ્રેમ કરે છે. તે જાદુઈ રીતે દરેક સંખ્યાને સાચું બનાવતું નથી, પરંતુ તે રમતમાં પ્રતિષ્ઠા ત્વચા મૂકે છે. નામાંકિત-સંશોધક ઓપન રિલીઝ અનામી ડમ્પ કરતાં વધુ ઝડપથી તણાવ-પરીક્ષણ પામે છે - સાથીદારો જાહેર લક્ષ્યને પસંદ કરે છે.
બિલ્ડરો માટે, વ્યવહારુ અર્થ એ છે કે ઍક્સેસ. ઓપન વેઇટ વત્તા અપાચે 2.0 સ્ટાઇલ લાઇસન્સ (જેમ કે લોન્ચ દરમિયાન આવરી લેવામાં આવ્યું હતું) નો સામાન્ય રીતે અર્થ એ થાય છે કે તમે સંશોધન-માત્ર લાઇસન્સ કરતાં ઓછા ગોચા સાથે વ્યાવસાયિક રીતે પ્રયોગ કરી શકો છો. કંઈપણ મોકલતા પહેલા રિલીઝમાં વાસ્તવિક લાઇસન્સ ફાઇલો જાતે તપાસો; કવરેજ સારાંશ કરાર નથી. તે પેડન્ટિક લાગે છે, પરંતુ લાઇસન્સ પેડન્ટ્રી સ્ટાર્ટઅપ્સને બચાવે છે.
સામાજિક પ્રવર્ધન પેટર્ન પરિચિત છે: સંશોધક પોસ્ટ, આદરણીય એમ્પ્લીફાયર ક્વોટ-પોસ્ટ, પછી "એજન્ટો આખરે ઉકેલાયા" ની લહેર આવે છે. હાર્નેસ વિગતો શેર કરતા લોકો માટે ફિલ્ટર કરો. એક સફળ કોડિંગ રનના સ્ક્રીનશોટ મૂડ થિયેટર છે, વિજ્ઞાન નહીં. 🛰️
સ્ટેટ-ટુ-એક્શન લૂપ્સ એજન્ટિક કોડિંગ કેમ ધરાવે છે
એજન્ટિક કોડિંગ એક ક્રૂર વાતાવરણ છે. મોડેલ રેપો સ્નેપશોટ, શેલ ટ્રાન્સક્રિપ્ટ, કદાચ નિષ્ફળ પરીક્ષણ જુએ છે, અને તેને સંપાદન અથવા આદેશ પસંદ કરવો પડે છે. ચેટ કરતાં સફળતા વધુ વખત દ્વિસંગી હોય છે. કાં તો પરીક્ષણ લીલું થાય છે અથવા તે થતું નથી. તે પુરસ્કાર આકાર એવી નીતિઓની તરફેણ કરે છે જે સુંદર નિષ્ફળતા નિબંધો લખતા મોડેલો કરતાં ક્રિયાઓ સ્વચ્છ રીતે પસંદ કરે છે.
વિરોધાભાસી તાલીમ વાર્તાઓ તે દુનિયામાં યોગ્ય છે કારણ કે તે સ્પષ્ટપણે આપેલ સ્થિતિ હેઠળ નેટવર્કને પસંદગીની ક્રિયાઓ તરફ ધકેલે છે. તેને જુનિયર એન્જિનિયરને "જ્યારે તમે આ ભૂલ વર્ગ જુઓ છો, ત્યારે આ ફિક્સ પેટર્ન માટે પહોંચો" શીખવવા જેવું વિચારો, "કમ્પાઇલર્સ કેમ મુશ્કેલ છે તે વિશે બ્લોગ પોસ્ટ લખો" ને બદલે. જુનિયરને હજુ પણ નિર્ણય લેવાની જરૂર છે; શોર્ટકટ ફક્ત ખલેલ ઘટાડે છે.
અહીં લેટન્સીનું સંયોજન છે. ધારો કે કોઈ એજન્ટ મધ્યમ બગફિક્સ લેન્ડ કરવા માટે સરેરાશ એંસી ટૂલ સ્ટેપ્સ લે છે. પ્રતિ સ્ટેપ 150 ms શેવ કરો અને તમે બાર સેકન્ડ વોલ ક્લોક ફરીથી મેળવો છો - જે ફ્લો સ્ટેટ અને ઇમેઇલ ચેક કરવા માટે ઓલ્ટ-ટેબિંગ કરતા વપરાશકર્તા વચ્ચેનો તફાવત છે. એજન્ટોના કાફલા ચલાવતી ટીમો ક્લાઉડ બિલ્સમાં પણ આ ગણિત અનુભવે છે. Jev-ક્લાસ પીઅર સામે દાવો કરાયેલ ક્રમ-ઓફ-મેગ્નિટ્યુડ ઇન્ફરન્સ સ્પીડઅપ, ભલે તે જંગલમાં "માત્ર" 4× તરીકે લેન્ડ થાય, છતાં પણ ક્ષમતા આયોજનને ફરીથી ગોઠવે છે.
મીટિંગ્સમાં હું એક અસ્થિર રૂપકનો ઉપયોગ કરું છું: ટોકન-બાય-ટોકન ચેટ મોડેલ્સ દરેક આંતરછેદ પર રૂટ પર ચર્ચા કરવા જેવા છે, જ્યારે સિસ્ટમ 1 શૈલીનું નિયંત્રક શહેર ડ્રાઇવિંગ માટે સ્નાયુ મેમરી જેવું છે. નવા શહેરમાં સ્નાયુ મેમરી નિષ્ફળ જાય છે. જ્યારે રેપો સંસ્કૃતિ વિશિષ્ટ હોય ત્યારે સંકુચિત રીતે ટ્યુન કરેલ એક્શન મોડેલ પણ આવું જ કરે છે. તમે હજુ પણ નવી સ્થાપત્ય પસંદગીઓ માટે વિચારશીલ મોડ્સ ઇચ્છો છો; તમે પચાસમા "આયાતને ઠીક કરો અને ફરીથી ચલાવો" માટે પ્રતિબિંબ ઇચ્છો છો. હાઇબ્રિડ સ્ટેક્સ - ઝડપી CLM જેવા નિયંત્રક અને સખત શાખાઓ પર ભારે તર્ક - કદાચ ત્યાં છે જ્યાં ગંભીર સિસ્ટમો ઉતરે છે, ભલે લોન્ચ પોસ્ટ્સ એક જ હીરો મોડેલ વેચે. 🚦
આ ઉપરાંત, મોટેથી કહેવું યોગ્ય છે: ડીપએસડબલ્યુઇ અને ટર્મિનલ-બેન્ચ રિવોર્ડ સ્કેફોલ્ડિંગ જેવા એજન્ટિક કોડિંગ બેન્ચ. હાર્નેસ ગુણવત્તા, ટૂલ અલોલિસ્ટ્સ અને રિકવરી પ્રોમ્પ્ટ સફળતા દરને બે આંકડામાં બદલી શકે છે. જ્યારે તમને હળવા ફાઇન-ટ્યુનિંગ પછી ~81.6% અથવા ~87.6% દેખાય, ત્યારે વજનની આસપાસ કયું રેપર બેઠું હતું તે શોધો. તે શેડ નથી; તે ક્ષેત્ર કેવી રીતે કાર્ય કરે છે તે છે.
ઓપન વેઇટ્સ, ફાઇન-ટ્યુનિંગ અને 35B શેડો
ઓપન વેઇટ દાવાની સામાજિક ગતિશીલતા બદલી નાખે છે. બંધ API મોડેલો ચાર્ટ ફ્લેશ કરી શકે છે અને તમને દૂષણ, ડીકોડિંગ યુક્તિઓ અથવા ગુપ્ત સિસ્ટમ પ્રોમ્પ્ટ વિશે અનુમાન લગાવવા દે છે. ડાઉનલોડ કરી શકાય તેવા પરિમાણો સાથે તમે ઓછામાં ઓછું વસ્તુને પોક કરી શકો છો. તમારા આંતરિક કોડિંગ વાતાવરણ માટે CLM-8B ને ફાઇન-ટ્યુનિંગ - તમારા લિન્ટ નિયમો, તમારા ડિપ્લોય CLI, તમારા મોનોરેપો ટોપોલોજી - એ ચળકતા બેન્ચ નંબરો માટે વાસ્તવિક માર્ગ છે, પહેલા દિવસે શૂન્ય-શોટ જાદુ નહીં.
અપાચે 2.0 ફ્રેમિંગ (કવરેજ મુજબ) બિલ્ડર-ફ્રેન્ડલી છે: પેટન્ટ ગ્રાન્ટ ભાષા, સ્પષ્ટ પુનઃવિતરણ ધોરણો, ઓછા "સંશોધન ફક્ત" ફાંદાઓ. ફરીથી: ફાઇલો વાંચો. કવરેજ લેખકો સારાંશ આપે છે; વકીલો નિષ્ણાત છે.
આયોજિત CLM-35B રોડમેપ સ્લાઇડમાં હાથી છે. મોટા મોડેલો ઘણીવાર ઇરાદાપૂર્વકની કુશળતા પાછી મેળવે છે અને "નાના અને ક્રૂર રીતે ઝડપી" આકર્ષણ ગુમાવે છે સિવાય કે નિસ્યંદન અથવા સટ્ટાકીય યુક્તિઓ વિલંબતાને નિયંત્રણમાં રાખે. જો આઠ-બિલિયન વેરિઅન્ટ સ્પોર્ટ્સ કાર હોય અને પાંત્રીસ-બિલિયન ટૂરિંગ સેડાન હોય, તો ટીમો બંને રાખી શકે છે: હોટ લૂપ્સ માટે 8B, સખત આયોજન માટે 35B. અથવા જો હાર્ડવેર સસ્તું થતું રહે તો મોટું મોડેલ ફક્ત પ્રભુત્વ મેળવી શકે છે. ભવિષ્યમાં કયું આવશે તે હજુ પણ અનિશ્ચિત છે; ભવિષ્યની પ્રકાશન નોંધો નક્કી કરશે, આ ફકરો નહીં.
ઓપન એજન્ટ મોડેલ્સ સાથે એક સૂક્ષ્મ જોખમ: લોકો તેમને દર મર્યાદા વિના CI માં બોલ્ટ કરશે અને દૂષિત READMEs દ્વારા તાત્કાલિક ઇન્જેક્શન શોધશે. ઝડપી મોડેલ્સ દુરુપયોગને એ જ રીતે વિસ્તૃત કરે છે જે રીતે તેઓ વ્યવહારુ મૂલ્યને વિસ્તૃત કરે છે. ગાર્ડરેલ્સ વૈકલ્પિક કોસ્પ્લે નથી; તે ઉત્પાદન છે.
- ગુણવત્તાનું મૂલ્યાંકન કરતા પહેલા તમારા પોતાના ટ્રેસને ફાઇન-ટ્યુન કરો
- નવા કાર્યો માટે એસ્કેપ હેચ તરીકે ધીમા તર્કસંગતતા રાખો
- તમારા હાર્નેસમાં ઇન્સ્ટ્રુમેન્ટ લેટન્સી p50/p95, માત્ર ચોકસાઈ જ નહીં
- ધારો કે 35B ફરીથી પેરેટો સરહદને ખસેડશે
બરફ પડ્યા વિના Jev સરખામણી વાંચવી
Jev-ક્લાસ મોડેલ્સ સાથે સરખામણીઓ રેટરિકલ કાર્ય કરી રહી છે. તેઓ એજન્ટિક સ્પીડ ટાયરમાં એક પીઅર સ્થાપિત કરે છે જેથી "9× ઝડપી સુધી" એક સંદર્ભ હોય. સંબંધિત દાવાઓને એક એન્કરની જરૂર હોય છે, અને તે ઘણું બધું યોગ્ય છે. ભય એ છે કે સમગ્ર મૂલ્યાંકન સ્ટેકને એક જ ગુણકમાં ભાંગી નાખવું. બેચનું કદ, ચોકસાઇ, ડીકોડિંગ સેટિંગ્સ, સંદર્ભ લંબાઈ અને ટૂલ-કોલ સીરીયલાઇઝેશન - આ બધું "ઝડપી" નો અર્થ શું છે તે ફરીથી આકાર આપે છે, અને તે નોબ્સ ભાગ્યે જ એક જ સ્લાઇડમાં દેખાય છે.
જ્યારે ક્લસ્ટર સારાંશ ટર્મિનલ બેન્ચ સેટિંગ પર ~32 ms-ક્લાસ પ્રતિભાવો ટાંકે છે, ત્યારે "પ્રતિભાવ" ને એક અસ્પષ્ટ લેબલ તરીકે ગણો જ્યાં સુધી કોઈ સ્પષ્ટ ન કરે કે તેનો અર્થ પ્રથમ ટોકન, સંપૂર્ણ ક્રિયા JSON, અથવા કેશ્ડ ઉપસર્ગ છે. તે ભેદો માર્કેટિંગ મિલિસેકન્ડને એન્જિનિયરિંગ કલાકોમાં ફેરવે છે. ઓછી લેટન્સી સાથે તુલનાત્મક શૂન્ય-શોટ ગુણવત્તા એ સ્વપ્ન જોડી છે; જો સ્વતંત્ર જૂથો તે સ્વપ્નના અડધા ભાગની પણ પુષ્ટિ કરે છે, તો CLM-શૈલીની તાલીમ આર્કિટેક્ચર મીટિંગ્સમાં કાયમી સ્થાન મેળવે છે.
ત્યાં સુધી, જેવને એક નિશ્ચિત લીડરબોર્ડ કરતાં વધુ હરીફ વાર્તા તરીકે ગણો. હરીફો પોસ્ટ વેચે છે. તમારા પ્રોડક્શન KPI ને વાર્તાની પરવા નથી. કાર્ય સફળતા, ઉકેલાયેલી ટિકિટ દીઠ ડોલર અને માનવ હસ્તક્ષેપ દર માપો. જો કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ ફોર્ક આ જીતે છે, તો ઉજવણી કરો. જો તે ફક્ત ટ્વિટર જીતે છે, તો ચાલતા રહો. 🚶
થોડો વિરોધાભાસી સમય: હરીફાઈની વાર્તાઓ હજુ પણ પોતાનું વજન વધારે છે. તેઓ પ્રયોગશાળાઓને હવાદાર મૂડને બદલે આંકડા પ્રકાશિત કરવા દબાણ કરે છે. ફક્ત સ્કોરબોર્ડને રમત સાથે ગૂંચવશો નહીં.
આ પ્રકાશનને યોગ્ય રીતે મેળવવા માટે શું જરૂરી છે
CLM-8B ને સમાચાર ચક્રથી આગળ વધારવા માટે, કેટલીક બાબતો ધ્યાનમાં લેવી જરૂરી છે:
- પ્રતિકૃતિ: બહારના જૂથો દસ્તાવેજીકૃત વાનગીઓ સાથે હેડલાઇન લેટન્સી અને કોડિંગ સફળતા દરને મેચ કરવા સક્ષમ હોવા જોઈએ.
- પારદર્શિતાનો ઉપયોગ કરો: એજન્ટ રેપરની વિગતો શેર કરો જેણે DeepSWE અને ટર્મિનલ-બેન્ચ સ્કોર્સ બનાવ્યા.
- લેબ ટેલિપેથી ધારણ ન કરતા દસ્તાવેજો: સ્ક્રિપ્ટો, ઇવલ આદેશો અને હાર્ડવેર નોંધોને સ્પષ્ટ કરો.
- નિષ્ફળતા મોડ્સ: સિસ્ટમ 1 શૈલીના નિર્ણયો ક્યાં તૂટી જાય છે તે બતાવો - નવા API, અસ્પષ્ટ ટિકિટો, સુરક્ષા-સંવેદનશીલ ઑપ્સ.
- અપગ્રેડ પાથ: સ્પષ્ટ કરો કે CLM-35B કેવી રીતે સંબંધિત છે જેથી ટીમો તેમના સ્ટેકને 8B ડેડ એન્ડમાં ઓવરફિટ ન કરે.
જો તે બોક્સ ખાલી રહે છે, તો મોડેલ બીજું રસપ્રદ પેપરવેઇટ બની જાય છે. જો તે ભરાય છે, તો એજન્ટ પ્લેટફોર્મને એક નક્કર ઘટક પસંદગી મળે છે: સખત વિચાર માટે ઇરાદાપૂર્વકનું LLM, ધ્રુજારીવાળા હાથ માટે વિરોધાભાસી ઝડપી મોડેલ. શ્રમનું તે વિભાજન એવું ડોળ કરવા કરતાં વધુ પુખ્ત લાગે છે કે એક મેગામોડેલે દરેક કામ દરેક લેટન્સી બજેટમાં કરવું જોઈએ.
એજન્ટો મોકલતા બિલ્ડરો માટે વ્યવહારુ ટેકવેઝ
તમારે કાલે તમારા સ્ટેકને ફરીથી લખવાની જરૂર નથી. નિર્ણય-ઝડપી મોડેલોનું મૂલ્યાંકન કરવા માટે તમારે એક યોજનાની જરૂર છે. તમારા એજન્ટનો લેટન્સી-ક્રિટીકલ સ્લાઇસ કોતરીને શરૂઆત કરો - કદાચ ટર્મિનલ માઇક્રો-લૂપ અથવા "આગળનું ગ્રેપ પસંદ કરો" પગલું - અને તમારા વર્તમાન વર્કહોર્સ સામે CLM-8B ફાઇન-ટ્યુન A/B કરો. હાર્નેસ સતત રાખો. બધું લોગ કરો.
શાંત ગુણવત્તાના રીગ્રેશન પર નજર રાખો: જે મોડેલો આત્મવિશ્વાસથી ખોટી ક્રિયાઓનો તાત્કાલિક જવાબ આપે છે તે ઉચ્ચ-દાવના રેપોમાં ધીમા સાચા કરતા વધુ ખરાબ હોય છે. ચકાસણી પગલાં ઉમેરો. ઉલટાવી શકાય તેવા સાધનોને પ્રાધાન્ય આપો. જ્યારે આત્મવિશ્વાસ ઓછો હોય ત્યારે બીજા મોડેલ કોલનું બજેટ બનાવો - હા, તે સ્પીડ જીતનો થોડો ભાગ ખાઈ જાય છે, અને તે સારું છે. બ્રેક્સ વિનાની ગતિ ડેમો આઉટેજમાં કેવી રીતે ફેરવાય છે તે દર્શાવે છે.
ઓર્ગેનાઇઝેશન બાજુએ, ક્ષમતા શીટ્સને ફક્ત ટોકન્સ પ્રતિ સેકન્ડને બદલે "GPU દીઠ ક્રિયાઓ" માટે કૉલમ સાથે અપડેટ કરો. એજન્ટિક વર્કલોડ્સ કવિતા થ્રુપુટની નહીં, પણ નિર્ણયોની કાળજી રાખે છે. જો લેખકોનો ~9× દાવો તમારા હાર્ડવેર સાથે આંશિક રીતે સંપર્કમાં રહે છે, તો તમારી સ્પ્રેડશીટ અલગ દેખાશે. જો તે ન થાય, તો તમે સસ્તામાં શીખ્યા છો.
અને કૃપા કરીને, ઓપ્સના પ્રેમ માટે, ઉત્પાદન રહસ્યોને પ્રાયોગિક એજન્ટમાં પેસ્ટ ન કરો કારણ કે મોડેલ "સલામત" લાગ્યું. ઝડપી ખુલ્લા મોડેલો શેડો સિસ્ટમ્સને સ્પિન કરવાનું સરળ બનાવે છે જેની કોઈ સમીક્ષા કરતું નથી. પ્રક્રિયા હજુ પણ મહત્વપૂર્ણ છે.
ખુલ્લા થ્રેડો હજુ પણ લટકતા છે
કેટલાક વણઉકેલાયેલા મુદ્દાઓ મને સંપૂર્ણ પ્રમોશનલ મોડથી રોકે છે:
- કોડિંગ સફળતાનો કેટલો ભાગ વજન અને ડેટા અને રેપરને કારણે થયો છે તે હજુ સ્પષ્ટ નથી.
- જ્યારે કાર્યોને સ્થાનિક શેલ રીફ્લેક્સને બદલે લાંબા-ક્ષિતિજ આયોજનની જરૂર હોય ત્યારે સિસ્ટમ 1 ફ્રેમિંગ પાતળું થઈ શકે છે.
- CLM-35B લેટન્સી સ્ટોરીને જાળવી શકે છે અથવા બીજા મજબૂત મધ્યમ કદના LLM બની શકે છે.
- વિતરણ પરિવર્તન હેઠળ વિરોધાભાસી ક્રિયા પસંદગીઓ બરડ બની શકે છે - નવી ભાષાઓ, નવા ક્લાઉડ CLI, વિરોધી રેપો.
- જ્યારે ક્રિયાઓ મિલિસેકન્ડમાં એક્ઝિક્યુટ થાય છે ત્યારે સલામતી વાર્તાને હજુ પણ સક્રિયતાની જરૂર પડે છે.
તે ટીમમાં ડૂબકી લગાવવા માટે બનાવાયેલ ગોટા નથી. કોઈપણ ગંભીર દત્તક સમીક્ષા માટે આ ચકાસણીઓ છે. પ્રારંભિક ખુલ્લા પ્રકાશનો કાળજીપૂર્વક તપાસ અને ઘર્ષણને પાત્ર છે, આંધળા ઇન્સ્ટોલ નહીં.
નીચે લીટી
CLM-8B એક ખુલ્લું, અપાચે-ફ્રેમ્ડ (પ્રતિ કવરેજ) કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ છે જેનો હેતુ એજન્ટો માટે ઝડપી સ્ટેટ-ટુ-એક્શન વર્તણૂક છે, જે જાહેરમાં જેકી ક્વોક દ્વારા રજૂ કરવામાં આવ્યું હતું જેમાં અઝાલિયા મિર્હોસેની દ્વારા એમ્પ્લીફિકેશન કરવામાં આવ્યું હતું અને સ્ટેનફોર્ડ/NVIDIA-લિંક્ડ રિસર્ચ તરીકે ફ્રેમ કરવામાં આવ્યું હતું. હેડલાઇન દાવો કરે છે - Jev-ક્લાસ ઇન્ફરન્સ કરતાં લગભગ 9× ઝડપી, હળવા ફાઇન-ટ્યુનિંગ પછી મજબૂત DeepSWE અને ટર્મિનલ-બેન્ચ પરિણામો, ઘણી ઓછી લેટન્સી સાથે તુલનાત્મક શૂન્ય-શોટ ગુણવત્તા, જેમાં લગભગ ~32 ms-ક્લાસ ટર્મિનલ પ્રતિભાવો વિશે ચેટરનો સમાવેશ થાય છે - લેખક દ્વારા રિપોર્ટ કરાયેલ છે અને હજુ પણ વ્યાપક તૃતીય-પક્ષ પુષ્ટિની રાહ જોઈ રહ્યું છે. એક મોટું CLM-35B ક્ષિતિજ પર છે.
જો તમે એજન્ટિક કોડિંગ સિસ્ટમ્સ બનાવો છો, તો આ ધર્મ નહીં, પણ ધ્યાન કેન્દ્રિત મૂલ્યાંકન કરવા યોગ્ય છે. તેને હાઇબ્રિડ સ્ટેકમાં ઉમેદવાર સિસ્ટમ 1 નિયંત્રક તરીકે ગણો, તમારા પોતાના હાર્નેસને માપો, અને સ્વતંત્ર રન ન આવે ત્યાં સુધી દરેક ચાર્ટ પર CLAIM સ્ટીકર રાખો. રસપ્રદ ભાગ એ છે કે નવા લોગો સાથે બીજું ચેટ મોડેલ નથી. રસપ્રદ ભાગ એ છે કે શું નિર્ણય-આકારની તાલીમ એજન્ટોને બેદરકારીપૂર્વક ખોટા બનાવ્યા વિના તાત્કાલિક અનુભવ કરાવી શકે છે.
વ્યવહારુ ઉદાહરણ: CLM-8B માટે લેટન્સી-ક્રિટિકલ એજન્ટ માઇક્રો-લૂપ ઇવલ બનાવવું
વિશે લેખક ચાર્ટ હમણાં જ છોડી દેવામાં આવ્યા છે: એજન્ટો માટે Jev કરતા 9× ઝડપી હોવાનો દાવો કરતું નવું ઓપન AI મોડેલ પ્રેરક દેખાઈ શકે છે; તમારા હાર્નેસ એકમાત્ર મત ગણાય છે. અહીં યુકેની ઇન્ડી ટૂલિંગ ટીમે CLM-8B ને ઉમેદવાર સિસ્ટમ 1 નિયંત્રક તરીકે કેવી રીતે ગણ્યું - ચેટ રિપ્લેસમેન્ટ નહીં - અને તેને તેમના પોતાના ટર્મિનલ માઇક્રો-લૂપ પર માપ્યું.
દૃશ્ય
સેમ એક નાનું ઉત્પાદન ચલાવે છે જે પહેલાથી જ મલ્ટી-ફાઇલ રિફેક્ટર્સ માટે ભારે કોડિંગ એજન્ટનો ઉપયોગ કરે છે. પીડાદાયક સ્લાઇસ એ ગરમ લૂપ છે: નિષ્ફળ ટેસ્ટ ટ્રાન્સક્રિપ્ટ વાંચો, આગામી શેલ પસંદ કરો અથવા ક્રિયા સંપાદિત કરો, તેને ચલાવો, પુનરાવર્તન કરો. વપરાશકર્તાઓ પચાસ ટૂલ સ્ટેપ્સમાં વિન્ટર-ગ્લોવ્સ લેગ કરતાં નીરસ જવાબો વિશે ઓછી ફરિયાદ કરે છે. સોશિયલ પોસ્ટ્સ કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ વજન અને જેવ-ક્લાસ પીઅર્સ સામે દાવો કરાયેલ ~9× સ્પીડઅપ, તેમજ હળવા ફાઇન-ટ્યુનિંગ પછી મજબૂત ડીપએસડબ્લ્યુઇ / ટર્મિનલ-બેન્ચ આંકડાઓને વધારી રહી છે. સેમ પ્રેસ ચાર્ટ પર ઉત્પાદન ફરીથી લખવાનો ઇનકાર કરે છે.
તેઓ એક લેટન્સી-ક્રિટીકલ માઇક્રો-લૂપ બનાવે છે: તેમના પોતાના મોનોરેપોમાંથી વીસ ફિક્સ્ડ બગફિક્સ ટ્રેસ. વર્તમાન વર્કહોર્સ નવી આર્કિટેક્ચર ટિકિટો માટે ઇરાદાપૂર્વકનો માર્ગ જાળવી રાખે છે. CLM-8B - જો હોસ્ટ કરવામાં આવે અને તેમના ટ્રેસ પર થોડું ફાઇન-ટ્યુન કરવામાં આવે તો - તેને ફક્ત "પિક નેક્સ્ટ રિવર્સિબલ એક્શન" સ્ટેપ પર સ્પર્ધા કરવાની મંજૂરી છે, જ્યારે આત્મવિશ્વાસ ઓછો હોય ત્યારે એસ્કેપ હેચ તરીકે ધીમા રિઝનર સાથે.
ધ્યેય એક એવો A/B છે જે હાર્નેસને સતત રાખે છે: સમાન સાધનો, સમાન અલોલિસ્ટ, સમાન પુનઃપ્રયાસ નીતિ. પ્રતિ સેકન્ડ લોગ ક્રિયાઓ, p50/p95 લેટન્સી, કાર્ય સફળતા અને માનવ હસ્તક્ષેપો - પછી નક્કી કરો કે ઓપન વેઇટ સીટ મેળવે છે કે નહીં.
સહાયકને શું જોઈએ છે
- વાસ્તવિક કાર્યમાંથી વીસ અનામી નિષ્ફળ-પરીક્ષણ ટ્રેસ (ઇનપુટ + ફક્ત માન્ય સાધનો)
- એક નિશ્ચિત એજન્ટ રેપર: ટૂલ સ્કીમા, અલોલિસ્ટ, મહત્તમ પગલાં અને "કોલ સ્લો રીઝનર" શાખા
- એ જ વીસ કાર્યો માટે વર્તમાન મોડેલ પર બેઝલાઇન સ્કોર્સ
- CLM-8B હોસ્ટ (GPU વર્ગ, ચોકસાઇ, બેચ) માટે હાર્ડવેર નોંધો જેથી "ઝડપી" સંદર્ભ હોય
- દાવા સ્ટીકરનો નિયમ: લેખક DeepSWE / ટર્મિનલ-બેન્ચ / ~9× / ~32 ms આંકડાઓ લેબલ કરેલા રહે છે જ્યાં સુધી આ હાર્નેસ કંઈક પુનઃઉત્પાદિત ન કરે
- એક માનવ માલિક જે કોઈપણ CI બોલ્ટ-ઓન પહેલાં ખોટી-પણ ઝડપી ક્રિયાઓની સમીક્ષા કરે છે
ઉદાહરણ સૂચના
તમે મને અમારા કોડિંગ એજન્ટની અંદર ફાસ્ટ સ્ટેટ→એક્શન કંટ્રોલર તરીકે CLM-8B માટે વાજબી A/B ડિઝાઇન કરવામાં મદદ કરી રહ્યા છો. મેં પેસ્ટ કરેલા હાર્નેસ ફેક્ટ્સનો જ ઉપયોગ કરો. લેટન્સી મલ્ટિપ્લાયર્સ, ડીપએસડબલ્યુઇ સ્કોર્સ અથવા લાઇસન્સ ટર્મ્સ શોધશો નહીં.
કાર્ય: મારા વીસ કાર્ય નામો અને વર્તમાન બેઝલાઇન નોંધોમાંથી, (1) કૉલમ સાથે સ્કોરિંગ શીટ ડ્રાફ્ટ કરો કાર્ય / મોડેલ / પગલાં / વોલ-ક્લોક / સફળતા (પાસ/નિષ્ફળ) / માનવ હસ્તક્ષેપ (y/n) / નોંધો, (2) છ-બુલેટ પ્રોટોકોલ જે મોડેલોમાં રેપરને સમાન રાખે છે, અને (3) સ્પષ્ટ રોજિંદા શબ્દોમાં નિર્ણય નિયમ કે જ્યારે CLM-8B માઇક્રો-લૂપ ધરાવી શકે છે અને જ્યારે આપણે ધીમા તર્ક તરફ આગળ વધીએ છીએ.
મર્યાદાઓ: યુકે અંગ્રેજી. જો લેખક દ્વારા રિપોર્ટ કરાયેલ દરેક નંબર દેખાય તો તેને CLAIM તરીકે લેબલ કરો. ઉલટાવી શકાય તેવા સાધનોને પ્રાધાન્ય આપો. "એજન્ટ્સ આખરે ઉકેલાયા" ભાષા પર પ્રતિબંધ મૂકો. જો મારા પેસ્ટમાંથી કોઈ મેટ્રિક ખૂટે છે, તો અનુમાન લગાવવાને બદલે [NEED MAESUREMENT] લખો.
આઉટપુટ: સ્કોરિંગ-શીટ હેડર અને પ્લેસહોલ્ડર્સનો ઉપયોગ કરીને એક ભરેલી ઉદાહરણ પંક્તિ, પ્રોટોકોલ બુલેટ્સ, પછી એસ્કેલેટ/કીપ નિયમ. કોઈ પ્રસ્તાવના નથી.
તેનું પરીક્ષણ કેવી રીતે કરવું
- વર્તમાન વર્કહોર્સ પર અને સમાન રેપર સાથે CLM-8B ફાઇન-ટ્યુન પર સમાન દસ ટ્રેસ ચલાવો. ખાતરી કરો કે ફક્ત દિવાલ-ઘડિયાળ અને સફળતા અલગ છે - ટૂલ સૂચિઓ નહીં.
- પૂછો: "આ અઠવાડિયે કયા લેખક ચાર્ટ ઉત્પાદનમાં ફેરફાર કરી શકે છે?" એક સારો જવાબ: જ્યાં સુધી આ હાર્નેસ સફળતા અને લેટન્સી પર એકસાથે જીત ન બતાવે ત્યાં સુધી કોઈ નહીં.
- એજ કેસ: CLM-8B જવાબો ~30 ms માં વિનાશક આદેશ સૂચન સાથે - CI પહેલાં અલોલિસ્ટની પુષ્ટિ કરો અને માનવ સમીક્ષા તેને પકડી લે.
- એજ કેસ: વીસ ટ્રેસની બહાર નોવેલ API ટિકિટ - ખાતરી કરો કે સ્લો રીઝનર તેની માલિકી ધરાવે છે, રીફ્લેક્સ મોડેલ નહીં.
- સ્વીકૃતિ તપાસ: (1) માપેલા પરિણામ તરીકે કોઈ શોધાયેલ 9× દાવો નથી, (2) p50 અને p95 લેટન્સી લોગ થયેલ છે, (3) સફળતા છેદ એ વીસ કાર્યો છે, (4) ખોટી-ઝડપી ક્રિયાઓ ગણાય છે, (5) કોઈપણ વાણિજ્યિક જહાજ યોજના પહેલાં અપાચે/લાઇસન્સ તપાસ ઑફલાઇન થાય છે.
પરિણામ
ઉદાહરણરૂપ પરિણામ (વીસ ફિક્સ્ડ મોનોરેપો ટ્રેસ પર એક ત્રણ-વ્યક્તિ ટૂલિંગ ટીમ માટે ઉદાહરણ અંદાજ, લેખકોના બેન્ચના સ્વતંત્ર લેબ રિરન નહીં): બેઝલાઇન વર્કહોર્સે માનવ સહાય વિના 20 માંથી 14 ટ્રેસ પૂર્ણ કર્યા; સરેરાશ સ્ટેપ લેટન્સી લગભગ 180 ms; ખોટા સંપાદન પછી બે ટ્રેસને માનવની જરૂર હતી. આંતરિક ટ્રેસ (સમાન રેપર) પર CLM-8B ના હળવા ફાઇન-ટ્યુન પછી, 20 માંથી 15 મદદ વિના પસાર થયા; તેમના સિંગલ-GPU હોસ્ટ પર સરેરાશ સ્ટેપ લેટન્સી લગભગ 45 ms; લાગુ કરતા પહેલા એક વધારાની ખોટી-ઝડપી ક્રિયા અલોલિસ્ટ દ્વારા પકડાઈ હતી. વીસ-ટ્રેસ સ્યુટ માટે વોલ-ક્લોક લગભગ 38 મિનિટથી ઘટીને લગભગ 22 મિનિટ થઈ ગઈ જેમાં ચકાસણી પગલાંનો સમાવેશ થાય છે. સ્વચ્છતા ચેકલિસ્ટ પર (હાર્નેસ સતત રાખવામાં આવ્યો, લેખક ચાર્ટ પર ક્લેમ લેબલ્સ રાખવામાં આવ્યા, નવલકથા ટિકિટ માટે ધીમા રીઝનરનો ઉપયોગ હજુ પણ થાય છે, પ્રાયોગિક એજન્ટમાં કોઈ ઉત્પાદન રહસ્યો નથી), 5 માંથી 5 સમીક્ષા આઇટમ્સ પસાર થઈ. મર્યાદાઓ: નાનો કાર્ય સેટ, એક હાર્ડવેર વર્ગ, ફાઇન-ટ્યુન ડેટા ગુણવત્તા પ્રભુત્વ ધરાવે છે; આ હાર્નેસની બહાર લેખકોના ~9× અથવા DeepSWE આંકડાઓને માન્ય કરતું નથી.
તમારા પોતાના સંસ્કરણને માપવા માટે: વીસ ટ્રેસ ફ્રીઝ કરો; પહેલા વર્તમાન મોડેલને સ્કોર કરો; દસ્તાવેજીકૃત ચોકસાઇ/સેટિંગ્સ સાથે CLM-8B હોસ્ટ કરો; તે જ રેપર સાથે ફરીથી ચલાવો; રિપોર્ટ સક્સેસ/n, p50/p95, હસ્તક્ષેપો, અને શું કોઈપણ CLAIM નંબરને હકીકત તરીકે ગણવામાં આવ્યો હતો.
શું ખોટું થઈ શકે છે?
- ચાર્ટ પૂજા: તમારા પોતાના p95 વગર ~9× સ્લાઇડ પર શિપિંગ.
- ખોટી-ઝડપી ક્રિયાઓ: હાઈ-સ્ટેક રિપોઝમાં ધીમી સુધારેલી ભૂલોને હરાવીને તાત્કાલિક આત્મવિશ્વાસપૂર્ણ ભૂલો.
- હાર્નેસ ડ્રિફ્ટ: મોડેલો વચ્ચે ટૂલ પ્રોમ્પ્ટ બદલવાનું અને તેને મોડેલ જીત કહેવાનું.
- સિંગલ-હીરો સ્ટેક: નવલકથા સ્થાપત્ય કાર્ય માટે ઇરાદાપૂર્વકના તર્કને છોડી દેવું.
- લાઇસન્સ હાથથી લહેરાવવું: વાસ્તવિક વજન-રેપો લાઇસન્સ ફાઇલોને બદલે કવરેજ સારાંશ પર વિશ્વાસ કરવો.
- શેડો CI: દર મર્યાદા અથવા ઇન્જેક્શન સમીક્ષા વિના પાઇપલાઇન્સમાં ઝડપી ખુલ્લા એજન્ટને બોલ્ટ કરવું.
વ્યવહારુ ઉપાય
એજન્ટિક કોડિંગ - ઓપન વેઇટ, ડિસિઝન-આકારની વાર્તા, લેખક-રિપોર્ટેડ સ્પીડ દાવાઓ માટે ઉમેદવાર સિસ્ટમ 1 કંટ્રોલર તરીકે CLM-8B એક કેન્દ્રિત મૂલ્યાંકન કરવા યોગ્ય છે. જ્યાં સુધી તમારું હાર્નેસ એવું ન કહે ત્યાં સુધી તે કોઈ પંથ નથી અને તમારા સ્ટેક માટે સાબિત 9× નથી. રેપરને સતત રાખો, પ્રતિ સેકન્ડ ક્રિયાઓ લોગ કરો અને ખોટો-ઝડપી દર રાખો, ધીમો એસ્કેપ હેચ રાખો, અને દરેક પ્રેસ ચાર્ટ પર CLAIM સ્ટીકર છોડી દો જ્યાં સુધી સ્વતંત્ર રન (તમારા સહિત) ન આવે.
વારંવાર પૂછાતા પ્રશ્નો
CLM-8B શું છે, અને એજન્ટ બિલ્ડરો તેના વિશે શા માટે વાત કરી રહ્યા છે?
CLM-8B એ કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ લાઇનમાં સેટ કરેલું પ્રથમ પબ્લિક વેઇટ છે - એક ઓપન રિસર્ચ રિલીઝ જે એજન્ટો માટે ઝડપી નિર્ણય લૂપ તરીકે રજૂ કરવામાં આવ્યું છે, ફક્ત બીજા ચેટ બ્રેઇન તરીકે નહીં. તાલીમ વાર્તા રાજ્યોને ધીમા નેક્સ્ટ-ટોકન નિબંધ કરતાં સિસ્ટમ 1 રીફ્લેક્સ જેવી ક્રિયાઓ સાથે જોડે છે. આઠ અબજ પરિમાણો પર તે ઘણા લેબ્સ અને ઇન્ડી બિલ્ડરો માટે હોસ્ટ કરવા માટે પૂરતું નાનું છે, જેમાં Apache 2.0 લાઇસન્સિંગ ડ્રોપની આસપાસ કવરેજમાં ફ્રેમ કરવામાં આવ્યું છે. લોન્ચ પોસ્ટ્સમાં સંખ્યાઓ લેખક દ્વારા અહેવાલ કરાયેલા દાવાઓ છે, સ્વતંત્ર લેબ રિરન નથી.
એજન્ટો માટે CLM-8B Jev કરતા 9× ઝડપી હોવાનો દાવો કેવી રીતે કરે છે?
પ્રમોટર્સ Jev-ક્લાસ મોડેલો કરતાં લગભગ 9× ઝડપી અનુમાનનો દાવો કરે છે, ટર્મિનલ બેન્ચ સેટિંગ પર લગભગ 32 ms-ક્લાસ પ્રતિભાવો સાથે ચેટર કરે છે. હળવા ફાઇન-ટ્યુનિંગ પછી તેઓ મજબૂત એજન્ટિક કોડિંગ પરિણામો પણ રિપોર્ટ કરે છે - DeepSWE લગભગ 81.6% અને ટર્મિનલ-બેન્ચ 2.1 લગભગ 87.6% - અને ઘણી ઓછી લેટન્સી પર Jev સાથે તુલનાત્મક કેટલીક શૂન્ય-શોટ ગુણવત્તા. 9× અને મિલિસેકન્ડ આંકડાઓને દાવા તરીકે ગણો જ્યાં સુધી તૃતીય પક્ષો તેમને શેર કરેલા હાર્ડવેર પર પુનઃઉત્પાદિત ન કરે. સંબંધિત ગતિને હજુ પણ બેચ કદ, ચોકસાઇ અને ડીકોડિંગ સેટિંગ્સની જોડણીની જરૂર છે.
કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ તાલીમ સામાન્ય LLM તાલીમ કરતા કેવી રીતે અલગ છે?
મોટાભાગના પ્રોડક્શન LLM એક સમયે એક ટોકન જનરેટ કરે છે, જે ગદ્ય અને લાંબા તર્ક માટે કામ કરે છે પરંતુ એજન્ટ દ્વારા લેવામાં આવતા દરેક સૂક્ષ્મ-નિર્ણય પર કર લાદે છે. કોન્ટ્રાસ્ટિવ લેંગ્વેજ મોડેલ તાલીમ, જેમ કે પ્રમોટર્સ તેનું વર્ણન કરે છે, નેટવર્કને પરિસ્થિતિઓને પસંદગીની ચાલ પર મેપ કરવા માટે દબાણ કરે છે - નવલકથાકાર કરતાં નીતિ વડાની જેમ. તે સિસ્ટમ 1 ફ્રેમિંગ ટૂલ કોલ્સ વચ્ચે કાયમ માટે વર્ણન કરવા કરતાં ઝડપી સ્ટેટ-ટુ-એક્શન લૂપ્સની તરફેણ કરે છે. CLM-8B હજુ પણ ટેક્સ્ટ ઉત્સર્જન કરી શકે છે; ઉદ્દેશ્ય અને મૂલ્યાંકન વાર્તા એજન્ટિક નિયંત્રણ તરફ ઢળેલી છે.
CLM-8B કોણે બહાર પાડ્યું, અને શું તે ખરેખર ખુલ્લું છે?
જેકી ક્વોકે કાર્ય રજૂ કર્યું; અઝાલિયા મિર્હોસેનીએ તેને વિસ્તૃત કર્યું; કવરેજ નામાંકિત સંશોધકો, જાહેર વજન અને ખુલ્લા કોડ સાથે સ્ટેનફોર્ડ અને NVIDIA-લિંક્ડ ટીમ પ્રયાસને ફ્રેમ કરે છે. રિલીઝની આસપાસ લાઇસન્સિંગ અપાચે 2.0 તરીકે ફ્રેમ કરવામાં આવ્યું છે, જે ફાઇન-ટ્યુનિંગ અને શિપિંગ માટે મહત્વપૂર્ણ છે - પરંતુ કવરેજ સારાંશ પર આધાર રાખતા પહેલા રેપોમાં લાઇસન્સ ફાઇલો વાંચો. નામાંકિત ઓપન રિલીઝ અનામી ડમ્પ કરતાં વધુ ઝડપથી તણાવ-પરીક્ષણ પામે છે. વ્યાપક તૃતીય-પક્ષ પ્રતિકૃતિ માટે હજુ વહેલું છે.
એજન્ટિક કોડિંગ માટે સ્ટેટ-ટુ-એક્શન લૂપ્સ શા માટે આટલા મહત્વપૂર્ણ છે?
એજન્ટિક કોડિંગ ઘણીવાર દ્વિસંગી હોય છે: ટેસ્ટ લીલો થાય કે ન થાય, તેથી સ્વચ્છ ક્રિયા પસંદગીઓ સુંદર નિષ્ફળતા નિબંધોને હરાવે છે. ડઝનેક ટૂલ સ્ટેપ્સમાં લેટન્સી સંયોજનો - પ્રતિ સ્ટેપ શેવ ટાઇમ અને વોલ ક્લોક અને ક્લાઉડ બિલ બંને આગળ વધે છે. Jev-ક્લાસ પીઅર સામે દાવો કરાયેલ ક્રમ-ઓફ-મેગ્નિટ્યુડ સ્પીડઅપ, ભલે તે જંગલમાં "માત્ર" 4× તરીકે ઉતરે, છતાં પણ ક્ષમતા આયોજનને ફરીથી ગોઠવે છે. હાઇબ્રિડ સ્ટેક્સ - એક ઝડપી CLM-જેવા નિયંત્રક અને સખત શાખાઓ પર ભારે રીઝનર - એક વાસ્તવિક લાંબા ગાળાના આકાર છે.
શું મારે CLM-8B માટે DeepSWE અને Terminal-Bench સ્કોર્સ પર વિશ્વાસ કરવો જોઈએ?
તે સ્યુટ્સ બરડ એજન્ટોને સજા આપે છે, તેથી જ ~81.6% DeepSWE અને ~87.6% ટર્મિનલ-બેન્ચ 2.1 હળવા ફાઇન-ટ્યુનિંગ પછી ઉત્તેજક લાગે છે. એજન્ટિક બેન્ચ પણ સ્કેફોલ્ડિંગને પુરસ્કાર આપે છે: હાર્નેસ ગુણવત્તા, ટૂલ અલોલિસ્ટ્સ અને રિકવરી પ્રોમ્પ્ટ સફળતાને બે અંકોથી બદલી શકે છે. ચાર્ટને સેટલ વિજ્ઞાન માનતા પહેલા વજનની આસપાસ કયું રેપર બેઠું હતું તે શોધો. લેખક બેન્ચ ત્યાં સુધી માર્કેટિંગ કરી રહ્યા છે જ્યાં સુધી કોઈ અન્ય તેમને દસ્તાવેજીકૃત વાનગીઓ સાથે પુનઃઉત્પાદિત ન કરે.
CLM-35B અને 8B મોડેલને ફાઇન-ટ્યુન કરવા વિશે મારે શું જાણવું જોઈએ?
યોજના તરીકે મોટા CLM-35B ફોલો-ઓનનો ઉલ્લેખ કરવામાં આવ્યો છે; ભલે તે લેટન્સી સ્ટોરી રાખે કે ડેપ્થ માટે સ્પીડ ટ્રેડ કરે, તે અનિશ્ચિત છે. CLM-8B ને તમારા પોતાના લિન્ટ નિયમો પર ફાઇન-ટ્યુનિંગ કરવું, CLI ડિપ્લોય કરવું અને મોનોરેપો ટ્રેસ એ મજબૂત સંખ્યાઓ માટે વાસ્તવિક માર્ગ છે - પહેલા દિવસે શૂન્ય-શોટ મેજિક નહીં. ટીમો જો બંને કદ લેન્ડ કરે તો રાખી શકે છે: હોટ લૂપ્સ માટે 8B, હાર્ડ પ્લાનિંગ માટે 35B. ખુલ્લા વજન પણ દુરુપયોગને સરળ બનાવે છે, તેથી ગાર્ડરેલ્સ અને રેટ મર્યાદા ઉત્પાદન છે, વૈકલ્પિક કોસ્પ્લે નહીં.
બરફ પડ્યા વિના હું Jev સરખામણીઓ કેવી રીતે વાંચી શકું?
Jev-ક્લાસ સરખામણીઓ "9× સુધી ઝડપી" પીઅર એન્કર આપે છે, જે પિચ લેન્ડ કરવામાં મદદ કરે છે. જોખમ એ છે કે બેચનું કદ, ચોકસાઇ, સંદર્ભ લંબાઈ અને ટૂલ-કોલ સીરીયલાઇઝેશન એક ગુણકમાં તૂટી જાય છે. જ્યારે ચેટર ~32 ms-ક્લાસ પ્રતિભાવો ટાંકે છે, ત્યારે પૂછો કે શું તેનો અર્થ પ્રથમ ટોકન, સંપૂર્ણ ક્રિયા JSON, અથવા કેશ્ડ ઉપસર્ગ છે. કાર્ય સફળતા, સોલ્વ કરેલી ટિકિટ દીઠ ડોલર અને તમારા સ્ટેક પર માનવ હસ્તક્ષેપ દર માપો. હરીફાઈના વર્ણનો લેબ્સને સંખ્યાઓ પ્રકાશિત કરવા દબાણ કરે છે; તમારા ઉત્પાદન KPI હજુ પણ નક્કી કરે છે.
પ્રોડક્શન એજન્ટોમાં CLM-8B નાખતા પહેલા બિલ્ડરોએ શું કરવું જોઈએ?
ટર્મિનલ માઇક્રો-લૂપ જેવી લેટન્સી-ક્રિટીકલ સ્લાઇસ બનાવો - અને હાર્નેસને સતત રાખીને તમારા વર્તમાન વર્કહોર્સ સામે A/B ફાઇન-ટ્યુન બનાવો. ખોટી-પણ-ઝડપી ક્રિયાઓ પર નજર રાખો; ચકાસણી ઉમેરો, ઉલટાવી શકાય તેવા સાધનો પસંદ કરો અને જ્યારે આત્મવિશ્વાસ ઓછો હોય ત્યારે ધીમા રીઝનરનું બજેટ બનાવો. પ્રતિ સેકન્ડ પ્રતિ GPU ક્રિયાઓ ટ્રૅક કરો, માત્ર પ્રતિ સેકન્ડ ટોકન્સ જ નહીં. પ્રાયોગિક એજન્ટોમાં ઉત્પાદન રહસ્યો પેસ્ટ કરશો નહીં, અને તમારા પોતાના રન આવે ત્યાં સુધી દરેક પ્રેસ ચાર્ટ પર CLAIM સ્ટીકર છોડો નહીં.
CLM-8B Just Droped દાવાઓ માટે હું વાજબી લેટન્સી માઇક્રો-લૂપ ઇવલ કેવી રીતે બનાવી શકું?
વાસ્તવિક નિષ્ફળતા-પરીક્ષણ ટ્રેસનો એક નાનો સેટ સ્થિર કરો, મોડેલોમાં સમાન ટૂલ સ્કીમા અને અલોલિસ્ટ રાખો, અને સ્ટેપ્સ, વોલ-ક્લોક, સફળતા અને માનવ હસ્તક્ષેપો લોગ કરો. જો તમે નવલકથા ટિકિટો માટે ઇરાદાપૂર્વકનો એસ્કેપ હેચ રાખો છો, તો ફક્ત "આગળની ઉલટાવી શકાય તેવી ક્રિયા પસંદ કરો" સ્ટેપ પર CLM-8B નો ઉપયોગ કરો. લેખક ~9×, DeepSWE અને મિલિસેકન્ડના આંકડાઓને દાવા તરીકે લેબલ કરો જ્યાં સુધી આ હાર્નેસ સફળતા અને લેટન્સી પર એકસાથે જીત ન બતાવે. તે કેન્દ્રિત eval સ્લાઇડ ડેક પર પુનઃલેખન ઉત્પાદનને હરાવે છે.
સંદર્ભ
- આલિંગન ચહેરો — વિરોધાભાસી ભાષા મોડેલ (CLM-v0.1-8B) — huggingface.co
- ગિટહબ — કોન્ટ્રાસ્ટિવ-એલએમ / સીએલએમ — github.com
- સ્ટેનફોર્ડ યુનિવર્સિટી — અઝાલિયા મિરહોસેની — cs.stanford.edu
- જેકી ક્વોક — jackyk02.github.io
- X — જેકી ક્વોક પરિચય — x.com
- DeepSWE — deepswe.datacurve.ai
- સ્નોર્કલ એઆઈ — ટર્મિનલ-બેન્ચ 2.1 — snorkel.ai
- જેવ — jevtypesafeai.com