Skip to content

Latest commit

 

History

History
355 lines (195 loc) · 54 KB

File metadata and controls

355 lines (195 loc) · 54 KB

ആരംഭിക്കറ്റുള്ളവർക്ക് ജനറേറ്റീവ് AIയ്ക്കായുള്ള ചെറുകിട ഭാഷാ മോഡലുകളിലേക്ക് പരിചയം

ജനറേറ്റീവ് AI എന്നത് പുതിയ ഉള്ളടക്കം സൃഷ്ടിക്കാൻ സഹായിക്കുന്ന സംവിധാനങ്ങൾ വികസിപ്പിക്കാനുള്ള കൃത്രിമ ബുദ്ധിമുട്ടിന്റെ അത്ഭുതഭരിതമായ ഒരു ശാഖയാണ്. ഈ ഉള്ളടക്കം വാചകങ്ങൾ, ചിത്രങ്ങൾ, സംഗീതം, പോലും മുഴുവൻ അവയവങ്ങൾ ഉള്ള വെർച്വൽ പരിതസ്ഥിതികൾ വരെ ആകാം. ജനറേറ്റീവ് AIന്റെ ഏറ്റവും സവിശേഷമായ പ്രയോഗങ്ങളിൽ ഒന്നാണ് ഭാഷാ മോഡലുകളുടെ മേഖലയിലെ പ്രയോഗം.

ചെറുകിട ഭാഷാ മോഡലുകൾ എന്താണ്?

സ്മോൾ ലാംഗ്വേജ് മോഡൽ (SLM) എന്നത് വലിയ ഭാഷാ മോഡൽ (LLM)ന്റെ ഒരു ചുരുങ്ങിയ രൂപമാണ്, LLMസിന്റെ പല നിർമാണ സിദ്ധാന്തങ്ങളും സാങ്കേതികവിദ്യകളും ഉപയോഗിച്ച്, എന്നാൽ കണക്കുകൂട്ടൽ വേഗത വളരെ കുറച്ച്.

SLMകൾ മനുഷ്യനു സാമ്യം ഉള്ള വാചകങ്ങൾ സൃഷ്ടിക്കാൻ രൂപകല്‍പന ചെയ്യപ്പെട്ട ഭാഷാ മോഡലുകളുടെ ഒരു ഉപവിഭാഗമാണ്. GPT-4 போன்ற വലിയ മോഡലുകൾക്കൊപ്പം താരതമ്യപ്പെടുത്തുമ്പോൾ, SLMകൾ കൂടുതൽ കൂറ്റൻതാഭമായും കാര്യക്ഷമവുമായിരിക്കുന്നു, അതുകൊണ്ടുതന്നെ കുറവു കണക്കുകൂട്ടൽ ശേഷിയുള്ള സംവിധാനങ്ങളിലോ പ്രയോഗങ്ങളിലോ ഇവ അനുയോജ്യമാണ്. ഇവ ചെറിയതായിട്ടും വൈവിധ്യമാർന്ന കാര്യങ്ങൾ ചെയ്യാൻ കഴിയും. സാധാരണയായി, SLMകൾ LLMകൾ സംയോജിപ്പിക്കുകയോ ചുരുക്കുകയോ ചെയ്യുമ്പോൾ നിർമ്മിക്കപ്പെടുന്നു, മൂല മോഡലിന്റെ പ്രവർത്തനക്ഷമതയും ഭാഷാശാസ്ത്രീയ ശേഷികളും കേവലം കുറച്ച് കുറയ്ക്കാതെ നിലനിർത്താൻ ലക്ഷ്യം വയ്ക്കുന്നു. മോഡലിന്റെ വലിപ്പം കുറയുന്നത് സമുച്ചയ സങ്കീർണത അനുവദനീയമാക്കുന്നു, ഇത് മെമ്മറി ഉപഭോഗവും കണക്കുകൂട്ടല്‍ ആവശ്യകതയ്‌ക്കുമായി കാര്യക്ഷമമാക്കുന്നു. ഈ മെച്ചപ്പെട്ട സൗകര്യങ്ങളുണ്ടെങ്കിലും, SLMകൾ പല സ്വഭാവങ്ങളായ സ്വാഭാവിക ഭാഷാ പ്രോസസ്സിംഗ് (NLP) പ്രവർത്തനങ്ങൾ നടത്താൻ കഴിയും:

  • വാചക സൃഷ്ടി: സुस്ഥിരവും സാന്ദർഭികരീതിയിലുള്ള വാചകങ്ങൾ അല്ലെങ്കിൽ പാരഗ്രാഫുകൾ സൃഷ്ടിക്കൽ.
  • വാചക പൂർത്തീകരണം: നൽകിയ പ്രേരണയുടെ അടിസ്ഥാനത്തിൽ വാചകങ്ങൾ പ്രവചിക്കുകയും പൂർത്തിയാക്കുകയും ചെയ്യണം.
  • ഭാഷാന്തരം: ഒരു ഭാഷയിൽ നിന്നു മറ്റൊരു ഭാഷയിലേക്ക് വാചകം മാറുക.
  • സംക്ഷേപണം: ദീര്‍ഘമായ വാചകങ്ങളെ ചെറിയ, മനസ്സിലാക്കാൻ എളുപ്പമുള്ള സംക്ഷേപങ്ങളാക്കി പരിമിതപ്പെടുത്തൽ.

വലിയ മോഡലുകളുമായി താരതമ്യം ചെയ്യുമ്പോൾ ചില പ്രവര്‍ത്തനക്ഷമതയിലോ ആഴത്തിലുള്ള മനസിലാക്കലിലോ ചില നഷ്ടങ്ങളും ഉണ്ടാകാം.

ചെറുകിട ഭാഷാ മോഡലുകൾ എങ്ങനെ പ്രവർത്തിക്കുന്നു?

SLMകൾ വ്യാപകമായ വാചക ഡാറ്റയിൽ പരിശീലനം പ്രാപിക്കുന്നു. പരിശീലന സമയത്ത്, അവ ഭാഷയുടെ മാതൃകകളും ഘടനകളും പഠിക്കുകയും സുതാര്യമായ, സാന്ദർഭികമായി അനുയോജ്യമായ വാചകങ്ങൾ സൃഷ്ടിക്കാൻ കഴിയും. പരിശീലന പ്രക്രിയയിൽ ഉൾപ്പെടുന്നതാണ്:

  • ഡാറ്റ ശേഖരണം: വ്യത്യസ്ത ഉറവിടങ്ങളിൽ നിന്ന് വലിയ വാചക ഡാറ്റസെറ്റുകൾ ശേഖരിക്കൽ.
  • മുൻപ്രോസസ്സിങ്: പരിശീലനത്തിന് അനുയോജ്യമായ ഡാറ്റ ശുചിത്വം നിർവ്വചിക്കുകയും ക്രമീകരിക്കുകയും ചെയ്യുക.
  • പരിശീലനം: യന്ത്ര പഠനം ആൾഗോരിതങ്ങൾ ഉപയോഗിച്ച് മോഡലിനെ വാചകം മനസ്സിലാക്കാനും സൃഷ്ടിക്കാനും പഠിപ്പിക്കൽ.
  • ഫൈൻ-ട്യൂണിംഗ്: പ്രത്യേക പ്രവർത്തനങ്ങളിൽ മോഡലിന്റെ പ്രകടനം മെച്ചപ്പെടുത്താൻ ആദാനങ്ങൾ സജ്ജീകരിക്കൽ.

SLMകൾ വളരുന്ന ആവശ്യങ്ങൾക്കനുസരിച്ച്, മൊബൈൽ ഉപകരണങ്ങൾ അല്ലെങ്കിൽ എഡ്ജ് കംപ്യൂട്ടിംഗ് പ്ലാറ്റ്‌ഫോമുകൾ പോലുള്ള പരിമിത വൻവിതരണമുള്ള സാഹചര്യങ്ങളിൽ വിനിയോഗിക്കാൻ ഉദ്ദേശിച്ചിട്ടുള്ളതാണ്, അവിടെ പൂർണ്ണവലിപ്പമുള്ള LLMകൾ ഭാരം കൂടിയ ആവശ്യങ്ങൾ കൊണ്ട് പ്രയാസമാകും. കാര്യക്ഷമതയിലേക്ക് ശ്രദ്ധ കേന്ദ്രീകരിച്ച്, SLMകൾ പ്രകടനവും ആക്‌സസിബിലിറ്റിയും തുല്യപ്പെടുത്തുന്നു, വ്യത്യസ്ത മേഖലകളിൽ വ്യാപകമായ പ്രയോഗം സാധ്യമാക്കുന്നു.

slm

പഠന ലക്ഷ്യങ്ങൾ

ഈ പാഠത്തിൽ, നമ്പർ അറിവുകൾക്ക് പരിചയം നൽകുകയും Microsoft Phi-3 നൽകപ്പെടുന്ന വിവിധ സഞ്ചാരങ്ങളിൽ വാചക ഉള്ളടക്കം, ദൃശ്യവും MoE പരിഗണിച്ചുള്ള അനുഭവങ്ങൾ പഠിക്കാനാണ് ഉദ്ദേശിക്കുന്നത്.

പാഠത്തിന്റെ അവസാനം താഴെ പറയുന്ന ചോദ്യങ്ങൾക്ക് നിങ്ങൾക്കുത്തരം നൽകാൻ കഴിയും:

  • SLM എന്താണ്?
  • SLMയും LLMഉം തമ്മിലുള്ള വ്യത്യാസം എന്താണ്?
  • Microsoft Phi-3/3.5 കുടുംബം എന്ത്?
  • Microsoft Phi-3/3.5 കുടുംബത്തെ ഉപയോഗിച്ച് പരിശോധന എങ്ങനെ നടത്താം?

തയ്യാറായി? തുടങ്ങാം.

വലിയ ഭാഷാ മോഡലുകൾ (LLMs) കൂടെ ചെറുകിട ഭാഷാ മോഡലുകൾ (SLMs) തമ്മിലുള്ള വ്യത്യാസങ്ങൾ

LLMകളും SLMകളും概率 വിധാന യന്ത്ര പഠനത്തിന്റേയുള്ള അടിസ്ഥാനം പങ്കുവയ്ക്കുന്നു, ആർക്കിടെക്ചറൽ രൂപകല്പന, പരിശീലന രീതികളും, ഡാറ്റ ഉത്പത്തി പ്രക്രിയകളും, മോഡൽ മൂല്യയിരുത്തലും ഏകദേശ സമാന രീതികൾ അനുസരിക്കുന്നു. എന്നിരുന്നാലും, വിവിധ പ്രധാന ഘടകങ്ങൾ ഈ രണ്ട് മോഡലുകൾ തമ്മിൽ വ്യത്യാസപ്പെടുത്തുന്നു.

ചെറുകിട ഭാഷാ മോഡലുകളുടെ പ്രയോഗങ്ങൾ

SLMകൾക്ക് വ്യാപകമായ പ്രയോഗങ്ങൾ ഉണ്ട്, ഉൾപ്പെടെ:

  • ചാറ്റ്ബോട്ടുകൾ: ഉപഭോക്തൃ പിന്തുണ നൽകുകയും ഉപയോക്താക്കളുമായി സംഭാഷണ രീതിയിൽ സംവദിക്കുകയും ചെയ്യുന്നു.
  • ഉള്ളടക്കം സൃഷ്ടി: എഴുത്തുകാർക്ക് ആശയങ്ങൾ നൽകുന്നതിനോ മുഴുവൻ ലേഖനങ്ങളും രൂപകൽപ്പന ചെയ്യുന്നതിനോ സഹകരിക്കുന്നു.
  • വിദ്യാഭ്യാസം: വിദ്യാർത്ഥികൾക്ക് എഴുത്തുപണി സഹായത്തിലോ പുതിയ ഭാഷകൾ പഠിക്കുമ്പോഴും സഹായം നൽകുന്നു.
  • ആക്‌സസിബിലിറ്റി: അശക്തരായ വ്യക്തികൾക്കായി ടക്‌സ്-ടു-സ്പീച്ച് സിസ്റ്റങ്ങളുപോലുള്ള ഉപകരണങ്ങൾ സൃഷ്ടിക്കുന്നു.

വലിപ്പം

LLMകളുടെയും SLMകളുടെയും മുഖ്യ വ്യത്യാസം മോഡലുകളുടെ വലിപ്പത്തിലാണ്. ChatGPT (GPT-4) പോലുള്ള LLMകൾ ഏകദേശം 1.76 ട്രില്യൺ പാരാമീറ്ററുകൾ ഉൾക്കൊള്ളാവുന്നതാണ്, എന്നാൽ Mistral 7B പോലുള്ള ഓപ്പൺ-സോഴ്സ് SLMകൾ വളരെ കുറഞ്ഞ, ഏകദേശം 7 ബില്യൺ പാരാമീറ്ററുകളോടു കൂടിയാണ് രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്. ഈ വ്യത്യാസം പ്രധാനമായും മോഡൽ ആർക്കിടെക്ചറും പരിശീലന പ്രക്രിയകളും തമ്മിലുള്ള വ്യത്യാസങ്ങൾക്ക് കാരണമാകുന്നു. ഉദാഹരണത്തിന്, ChatGPT എൻകോഡർ-ഡികോഡർ ഘടനയിൽ സെൽഫ്-അറ്റൻഷൻ യന്ത്രം ഉപയോഗിക്കും, എന്നാൽ Mistral 7B ഡികോഡർ മാത്രം മോഡലിൽ സ്ലൈഡിങ്ങ് വിൻഡോ അറ്റൻഷൻ ഉപയോഗിക്കുന്നു, അതു കൂടുതൽ കാര്യക്ഷമ പരിശീലനം ഉറപ്പാക്കുന്നു. ഈ ആർക്കിടെക്ചറൽ വ്യത്യാസം ഈ മോഡലുകളുടെ സങ്കീർണതക്കും പ്രകടനത്തിനും വലിയ സ്വാധീനം ചെലുത്തുന്നു.

ബോധം

SLMകൾ സാധാരണയായി പ്രത്യേക മേഖലകളിൽ പ്രകടനത്തിന് അനുയോജ്യമായി വേണ്ടത്ര മികച്ചവ ആണെങ്കിലും വ്യാപകമായ കാസ്റ്റ് ഉൾവിവരം നൽകുന്നതിൽ പരിമിതമായിരിക്കാം. മറുവശത്ത്, LLMകൾ മനുഷ്യനു സാമ്യമുള്ള ബുദ്ധി പകര്‍ന്നു മറുപടി നൽകാനാണ് ലക്ഷ്യമിട്ടിരിക്കുന്നത്. വ്യാപകവും വൈവിധ്യമാർന്ന ഡാറ്റാസെറ്റുകളിൽ പരിശീലനം പ്രാപിച്ച്, LLMകൾ വൈവിധ്യമാർന്ന മേഖലകളിൽ നന്നായി പ്രവർത്തിച്ചു, കൂടുതൽ ബഹുമുഖതയും അനുയോജ്യതയും നല്കുന്നു. അതുകൊണ്ട് LLMകൾ വാചക പ്രോസസ്സിംഗ്, പ്രോഗ്രാമിംഗ് എന്നിവ പോലുള്ള നിരവധി താഴെക്കടന്ന പ്രവർത്തനങ്ങളിലേക്കായി അനുയോജ്യമാണ്.

കമ്പ്യൂട്ടിംഗ്

LLMകൾ പരിശീലനവും വിനിയോഗവും വലിയ കമ്പ്യൂട്ടിംഗ് ഘടകർ ആവശ്യപ്പെടുന്നു, പാടാറായാൽ വലിയ GPU ക്ലസ്റ്റർ ഉൾപ്പെടുന്നു. ഉദാഹരണത്തിന്, ChatGPT പോലുള്ള ഒരു മോഡലിനെ മുടക്കാതെ പരിശീലിപ്പിക്കാൻ ആയിരക്കണക്കിന് GPU ഓളം കാലയളവിൽ ആവശ്യവും ഉണ്ടായിരിക്കും. മറുവശത്ത്, SLMകൾ ചെറിയ പാരാമീറ്റർ എണ്ണവുമായി കമ്പ്യൂട്ടിംഗ് ഉപകരണങ്ങളിലേക്കും ഉപയോഗിക്കാൻ എളുപ്പമാണ്. Mistral 7B പോലുള്ള മോഡലുകൾ സമർത്ഥ GPU ശേഷിയുള്ള പ്രാദേശിക യന്ത്രങ്ങളിൽ പരിശീലിപ്പിച്ച് പ്രവർത്തിപ്പിക്കാൻ കഴിയും, എന്നാൽ പരിശീലനത്തിന് GPU-കളിൽ പല മണിക്കൂറുകൾ വേണ്ടിവരും.

പുരോഗതി

LLMകളിൽ പ്രാധാന്യം നാളത്തെ പരിശീലന ഡാറ്റയുടെ സ്വഭാവ കാരണം പൂർവ്വാഗതിക പ്രശ്നമാണ്. ഇവ മോഡലുകൾ സാധാരണയായി ഇന്റർനെറ്റിൽ നിന്ന് ലഭ്യമായ കച്ച ഡാറ്റ ആശ്രയിക്കുന്നു, ഇത് ചില കൂട്ടങ്ങൾക്കു കുറഞ്ഞ പ്രാതിനിധ്യവുമോ തെറ്റായ ലേബലിങ്ങോ ഉണ്ടാക്കുകയും ഭാഷാശാസ്ത്ര വ്യത്യാസങ്ങൾ മൂലമുള്ള ക്‌ളദ്ദമായ മുൻവിധികൾ പ്രതിഫലിപ്പിക്കുകയും ചെയ്യാം. കൂടാതെ, LLM ആർക്കിടെക്ചറുകളുടെ സങ്കീർണത പൂർവ്വാഗതികൾ കൂടുതൽ ശക്തമാക്കാൻ കാരണമാകാം, ഇത് കൃത്യമായ ഫൈൻ-ട്യൂണിങ്ങില്ലാതെ ശ്രദ്ധയിൽപ്പെടാതെ പോകാം. മറുവശത്ത്, SLMകൾ കൂടുതൽ പരിധിയുള്ള, ഡൊമെയ്ൻ-സ്പെസിഫിക് ഡാറ്റാസെറ്റുകളിൽ പരിശീലനം പ്രാപിക്കുന്നതിനാൽ ഈ പൂർവ്വാഗതികൾക്ക് കുറവ് പ്രതിരോധം ഉണ്ടെങ്കിലും അവ പൂര്‍ണമായും ഒഴിവാക്കാൻ കഴിയില്ല.

പരിഗണന

SLMകളുടെ കുറവായ വലിപ്പം അവയ്ക്ക് പരിഗണന വേഗത്തിൽ വൻ നേട്ടം നൽകുന്നു, ഇത് ലീൽ ഹാർഡ്വെയറിൽ കാര്യക്ഷമമായി ഔട്ട്പുട്ടുകൾ സൃഷ്ടിക്കാൻ അനുവദിക്കുന്നു, വ്യാപകമായ സമാന്തര പ്രോസസ്സിംഗ് ആവശ്യമില്ലാതെ. LLMകൾക്ക് അവരുടെ വലിപ്പവും സങ്കീർണതയും കാരണം സ്വീകരിച്ച പരിഗണന സമയങ്ങൾക്കായി വലിയ സമാന്തര കമ്പ്യൂട്ടിംഗ് വലുപ്പം ആവശ്യമായേക്കാം. അനേകം സമകാലിക ഉപയോക്താക്കളുടെ സാന്നിദ്ധ്യം LLMകളുടെ പ്രതികരണ സമയം കുറയ്ക്കും, പ്രത്യേകിച്ചും വലിയ പ്രയോഗങ്ങളിൽ.

മൊത്തത്തിൽ, LLMകളും SLMകളും യന്ത്രം പഠനത്തിന്റെ അടിസ്ഥാനത്തിൽ നിന്നിട്ടുള്ളെങ്കിലും, മോഡൽ വലിപ്പം, വിഭവ ആവശ്യം, സാന്ദർഭിക മനസ്സിലാക്കൽ, പൂർവ്വാഗതികൾക്ക് നേരിടാനുള്ള സാധ്യത, പരിഗണന വേഗം എന്നിവയിൽ വലിയ വ്യത്യാസങ്ങൾ ഉണ്ട്. ഈ വ്യത്യാസങ്ങൾ അവയുടെ ഉപയോഗത്തിനുള്ള ലക്ഷ്യങ്ങളിൽ വ്യത്യാസം കാണിക്കുന്നു: LLMകൾ കൂടുതൽ ബഹുമുഖതയും വലിയ വിഭവ ആവശ്യവുമുള്ളതാണ്, എന്നാൽ SLMകൾ കുറവായ കണക്കുകൂട്ടൽ ആവശ്യങ്ങളോടെ ഡൊമൈൻ-നിര്ദിഷ്ട കാര്യക്ഷമത നൽകുന്നു.

കുറിപ്പ്: ഈ പാഠത്തിൽ Microsoft Phi-3/3.5 ഉപയോഗിച്ച് SLM പരിചയപ്പെടുത്തും.

Phi-3 / Phi-3.5 കുടുംബം പരിചയപ്പെടുക

Phi-3 / 3.5 കുടുംബം പ്രധാനമായും വാചകം, ദൃശ്യം, ഏജന്റ് (MoE) പ്രയോഗങ്ങളിലേക്കാണ് ലക്ഷ്യമിടുന്നത്:

Phi-3 / 3.5 ഇന്‍സ്‌ട്രക്റ്റ്

പ്രധാനമായും വാചക സൃഷ്ടി, ചാറ്റ് പൂർത്തീകരണം, ഉള്ളടക്കം വിവര ലഭ്യത എന്നിവയ്ക്കാണ്.

Phi-3-മിനി

3.8B പാരാമീറ്റർ ഉള്ള ഭാഷാ മോഡൽ Microsoft Foundry, Hugging Face, Ollama എന്നിവിടങ്ങളിൽ ലഭ്യമാണ്. Phi-3 മോഡലുകൾ തുല്യമായതിലോ വലുതിലോ ഉള്ള ഭാഷാ മോഡലുകളിൽ പ്രധാന ബ്രഞ്ച് മാർക്കുകളിൽ (താഴെ കാണുന്ന മാർക്ക് അടങ്ങിയിട്ടുണ്ട്, ഉയർന്ന നമ്ബറുകൾ മികച്ചതാണ്) ഏറെ മെച്ചമാണ്. Phi-3-മിനി അതിന്റെ രണ്ട് മടങ്ങ് വലിപ്പമുള്ള മോഡലുകൾക്ക് മേൽ വൈവിധ്യമാർന്ന രംഗങ്ങളിൽ മികച്ച പ്രകടനം കാണിക്കുന്നു, Phi-3-സ്കൂൾ വലുതായ മോഡലുകളെയും ഉൾപ്പെടെ GPT-3.5നെ തല്ലുന്നു.

Phi-3-സ്കൂൾ & മീഡിയം

വെറും 7B പാരാമീറ്ററുകൾ ഉള്ള Phi-3-സ്കൂൾ GPT-3.5Tയെ ഭാഷ, യുക്തിവാദം, കോഡിംഗ്, ഗണിതം തുടങ്ങിയ പല benchmarking ൽ തോല്പിക്കുന്നത്.

14B പാരാമീറ്ററുകളുള്ള Phi-3-മീഡിയം ഈ പ്രവണത തുടരുന്നു, Gemini 1.0 Proയെ പിന്നോട്ടാക്കുന്നു.

Phi-3.5-മിനി

Phi-3-മിനിയുടെ അപ്ഗ്രേഡ് ആയി കരുതാം. പാരാമീറ്ററുകൾ അതുപോലെ തന്നെയാണ്, എന്നാല്‍ ബഹുഭാഷ പിന്തുണ (20+ ഭാഷകൾ: അറബിക്ക്, ചൈനീസ്, ചെക്ക്, ഡാനിഷ്, ഡച്ചു, ഇംഗ്ലീഷ്, ഫിന്നിഷ്, ഫ്രഞ്ച്, ജർമൻ, ഹെബ്രു, ഹംഗേറിയൻ, ഇറ്റാലിയൻ, ജാപ്പനീസ്, കൊറിയൻ, നോർവീജിയൻ, പോളിഷ്, പോര്തുഗീസ്, റഷ്യൻ, സ്പാനിഷ്, സ്വീഡിഷ്, തായ്, ടർക്കിഷ്, യുക്രെയ്‌നിയൻ) മെച്ചപ്പെടുത്തി ദൈർഘ്യമുള്ള സാന്ദർഭിക പിന്തുണകൂടെ ചേർത്ത്.

3.8B പാരാമീറ്ററുകൾ ഉള്ള Phi-3.5-മിനി തുല്യ വലിപ്പമുള്ള ഭാഷാ മോഡലുകളുടേയും രണ്ടും മടങ്ങ് വലിപ്പമുള്ളവയോടും സമമാക്കുന്നു.

Phi-3 / 3.5 ദൃശ്യം

Phi-3/3.5യുടെ ഇൻസ്ട്രക്റ്റ് മോഡൽ Phiയ്ക്ക് മനസ്സിലാക്കാനുള്ള കഴിവാണ്, ദൃശ്യം Phiയ്ക്ക് ലോകം മനസ്സിലാക്കാനുള്ള കണ്ണുകളാണ്.

Phi-3-ദൃശ്യം

Phi-3-ദൃശ്യം, വെറും 4.2B പാരാമീറ്ററുകൾ കൊണ്ട്, ഈ പ്രവണത തുടരുന്നു, Claude-3 Haiku, Gemini 1.0 Pro V പോലുള്ള വലുതായ മോഡലുകൾക്കേൽ പൊതുവായ ദൃശ്യ യുക്തിവാദം, OCR, പട്ടിക/ഡയഗ്രാം മനസ്സിലാക്കൽ വക്കിൽ മുകളിൽ പ്രകടനം കാണിക്കുന്നു.

Phi-3.5-ദൃശ്യം

Phi-3.5-ദൃശ്യം Phi-3-ദൃശ്യമിന്റെ അപ്ഗ്രേഡ് ആണ്, ബഹുചിത്ര പിന്തുണ ചേർത്ത്. നിങ്ങളുടെ പകുപ്പ് ചിത്രങ്ങൾ മാത്രമല്ല, വീഡിയോകളും കാണാൻ കഴിയും എന്നാണ് കരുതാവുന്നത്.

Phi-3.5-ദൃശ്യം Claude-3.5 Sonnet, Gemini 1.5 Flash പോലുള്ള വലുതായ മോഡലുകൾക്കേൽ OCR, പട്ടിക/ചാർട്ട് മനസ്സിലാക്കൽ പ്രവർത്തനത്തിലും പൊതു ദൃശ്യം ബുദ്ധി പ്രവർത്തനത്തിലും സമം ആണെന്നും. ബഹുദ്ധൃശ്യ-ഇൻപുട്ട് പിന്തുണയും ഉണ്ട്, അഥവാ ബഹുചിത്ര ഇൻപുട്ടുകളിൽ യുക്തിവാദം ചെയ്യുന്നു.

Phi-3.5-MoE

മിശ്ര വിദഗ്ധർ (MoE) മോഡലുകൾ വളരെ കുറവായ കംപ്യൂട്ടുമായി മുന്‍ പരിശീലിപ്പിക്കാൻ സഹായിക്കുന്നു, അതായത് സമാന കംപ്യൂട്ട് ബഡ്ജറ്റിൽ മോഡലിന്റെ വലിപ്പം അല്ലെങ്കിൽ ഡാറ്റാസെറ്റ് വലുപ്പം വിപുലീകരിക്കാൻ കഴിയുന്നു. പ്രത്യേകിച്ച്, MoE മോഡലുകൾ അവരുടെ സാന്ദ്രമായ മാതൃകകളെക്കാൾ വേഗത്തിൽ മുന്നിൽ പരിശീലനത്തിൽ സമാനം നേടും.

Phi-3.5-MoE 16x3.8B വിദഗ്ധ മോഡ്യൂളുകൾ ഉൾക്കൊള്ളുന്നു. Phi-3.5-MoE 6.6B സജീവ പാരാമീറ്ററിനൊപ്പം വളരെയധികം വലുതായ മോഡലുകൾ പോലെയുള്ള യുക്തിവാദം, ഭാഷാ ബോധം, ഗണിതം ലഭിക്കുന്നു.

Phi-3/3.5 കുടുംബ മോഡലുകൾ വിവിധ സാഹചര്യങ്ങളിൽ ഉപയോഗിക്കാം. LLMപോലെ അല്ല, Phi-3/3.5-മിനി അല്ലെങ്കിൽ Phi-3/3.5-ദൃശ്യം എഡ്ജ് ഉപകരണങ്ങളിൽ വിനിയോഗിക്കാം.

Phi-3/3.5 കുടുംബ മോഡലുകൾ എങ്ങനെ ഉപയോഗിക്കുക

Phi-3/3.5 വ്യത്യസ്ത സാഹചര്യങ്ങളിൽ ഉപയോഗിക്കാനാണ് ഉദ്ദേശിക്കുന്നത്. തുടർന്ന്, വ്യത്യസ്ത സാഹചര്യങ്ങളെ അടിസ്ഥാനമാക്കി Phi-3/3.5 ഉപയോഗിക്കാം.

phi3

ക്ലൗഡ് APIകൾ വഴിക്കുള്ള പരിഗണന

Microsoft Foundry മോഡലുകൾ

കുറിപ്പ്: GitHub മോഡലുകൾ 2026 ജൂലൈ അവസാനം വിശ്രമിക്കുന്നു. Microsoft Foundry മോഡലുകൾ നേരിട്ട് പകരമുള്ളതാണ്.

Microsoft Foundry മോഡലുകൾ ഏറ്റവും നേരിട്ടുള്ള മാർഗമാണ്. Foundry മോഡൽ കാറ്റലോഗ് വഴി Phi-3/3.5-ഇൻസ്ട്രക്റ്റ് മോഡലിൽ দ্রুত ആക്‌സസ് ലഭിക്കും. Azure AI Inference SDK / OpenAI SDK ചേർത്താൽ കോഡ് വഴി API ആക്‌സസ് ചെയ്ത് Phi-3/3.5-ഇൻസ്ട്രക്റ്റ് കോൾ പൂർത്തിയാക്കാം. പ്ലേഗ്രൗണ്ടിൽ വ്യത്യസ്ത ഫലങ്ങൾ പരീക്ഷിക്കാമെന്നും.

  • ഡെമോ: ചൈനീസ് സാഹചര്യങ്ങളിൽ Phi-3-മിനി, Phi-3.5-മിനിയുടെ ഫല താരതമ്യം

phi3

phi35

Microsoft Foundry

ദൃശ്യവും MoE മോഡലുകളും ഉപയോഗിക്കേണ്ടതുണ്ടെങ്കിൽ, Microsoft Foundry ഉപയോഗിച്ച് കോൾ പൂർത്തിയാക്കാം. താല്പര്യമുള്ളവർ Phi-3 / 3.5 ഇന്‍സ്‌ട്രക്റ്റ്, ദൃശ്യം, MoE കോൾ ചെയ്യാൻ Microsoft Foundry വഴി Phi-3 കുക്ക്ബുക്ക് വായിക്കാം ഈ ലിങ്ക് ക്ലിക്ക് ചെയ്യുക

NVIDIA NIM

കേളി ക്ലൗഡ് അടിസ്ഥാന Microsoft Foundry മോഡൽ കാറ്റലോഗിന് പുറമെ, NVIDIA NIM ഉപയോഗിച്ച് ബന്ധപ്പെട്ട കോൾകൾ പൂർത്തിയാക്കാം. NVIDIA NIM (NVIDIA Inference Microservices) വികസിപ്പകരെ ഹൈ-പ്രഭാഷണ AI മോഡലുകൾ ക്ലൗഡുകൾ മുതൽ ഡാറ്റാ സെന്ററുകൾ, വർക്ക്‌സ്റ്റേഷനുകൾ വരെ വിവിധ പരിസ്ഥിതികളിലേക്ക് കാര്യക്ഷമമായി വിനിയോഗിക്കാൻ സഹായിക്കുന്ന പ്രവർത്തനം വേഗതയുള്ള മൈക്രോസർവീസ് സമുദായമാണ്.

ഇതാ NVIDIA NIMയുടെ ചില പ്രധാന സവിശേഷതകൾ:

  • വിനിയോഗ സൗകര്യം: NIM ഒരു കമാൻഡ് ഉപയോഗിച്ച് AI മോഡലുകൾ വിനിയോഗിക്കാൻ അനുവദിക്കുന്നു, നിലവിലെ പ്രവൃത്തിപദ്ധതികളുമായി എളുപ്പത്തിൽ ഏകീകരിക്കാൻ സഹായിക്കുന്നു.

  • മികച്ച പ്രകടനം: കുറഞ്ഞ താമസം കൂടാതെ ഉയർന്ന ത്രൂപുട്ട് ഉറപ്പാക്കാൻ TensorRT, TensorRT-LLM പോലെയുള്ള NVIDIAയുടെ മുൻകൂട്ടി മെച്ചപ്പെടുത്തപ്പെട്ട ഇൻഫറൻസ് എൻജിനുകൾ ഉപയോഗിക്കുന്നു.

  • സ്കെയിലബിലിറ്റി: NIM കുബേർനെറ്റിസിൽ ഓട്ടോസ്കെയ്ലിംഗിന് പിന്തുണ നൽകി വിവിധ തൊഴിലഭാരം ഫലപ്രദമായി കൈകാര്യം ചെയ്യാൻ സജ്ജമാണു.

  • സുരക്ഷയും നിയന്ത്രണവും: NIM മൈക്രോസർവീസുകൾ സ്വന്തം നിയന്ത്രിത അടിസ്ഥാനസൗകര്യത്തിൽ സ്വയം ഹോസ്റ്റുചെയ്ത്, സംഘടനകൾ തങ്ങളുടെ ഡാറ്റയും ആപ്ലിക്കേഷനുകളും നിയന്ത്രിക്കാൻ കഴിയും.

  • സ്റ്റാൻഡേർഡ് API കൾ: NIM വ്യവസായ സ്റ്റാൻഡേർഡ് API കളെ വിതരണം ചെയ്ത് ചാറ്റ്ബോട്ടുകൾ, AI അസിസ്റ്റന്റുകൾ തുടങ്ങിയ AI ആപ്ലിക്കേഷനുകൾ നിർമിക്കാൻ എളുപ്പമാക്കുന്നു.

NIM NVIDIA AI എന്റർപ്രൈസിന്റെ ഭാഗമാണ്, ഇത് AI മോഡലുകളുടെ വിന്യംശവും പ്രവർത്തനക്ഷമതയും എളുപ്പമാക്കുകയും NVIDIA GPU കളിൽ കാര്യക്ഷമമായി പ്രവർത്തിപ്പിക്കുകയും ചെയ്യാൻ ഉദ്ദേശിക്കുന്നു.

  • ഡെമോ: NVIDIA NIM ഉപയോഗിച്ച് Phi-3.5-Vision-API കോൾ ചെയ്യുക [Click this link]

Phi-3/3.5 പ്രാദേശികമായി പ്രവർത്തിപ്പിക്കൽ

Phi-3-ലേക്കോ GPT-3 പോലുള്ള മറ്റേതെങ്കിലും ഭാഷാമോഡലിലേക്കോ ബന്ധപ്പെട്ട ഇൻഫറൻസ് എന്നത് പ്രവേശിപ്പിച്ച ഇൻപുട്ടിനെ അടിസ്ഥാനമാക്കി പ്രതികരണങ്ങൾ അല്ലെങ്കിൽ പ്രവചനം സൃഷ്ടിക്കുന്ന പ്രക്രിയയെയാണ് സൂചിപ്പിക്കുന്നത്. Phi-3-ന് പ്രോംപ്റ്റ് അല്ലെങ്കിൽ ചോദ്യം നൽകിയപ്പോഴാണ്, ഇത് പരിശീലിപ്പിച്ച നെറൽ നെറ്റ്വർക്കിന്റെ സഹായത്തോടെ ഏറ്റവും സാധ്യതയുള്ള ബന്ധപ്പെട്ട മറുപടികൾ നിർണ്ണയിക്കുന്നതും പരിശീലന ഡാറ്റയിൽ ഉള്ള പാറ്റേണുകൾ വിശദമായി വിശകലനം ചെയ്യുന്നതുമായ പ്രക്രിയ.

Hugging Face ട്രാൻസ്ഫോർമർ Hugging Face Transformers ആശയവിനിമയപ്രവർത്തനങ്ങൾക്കും മറ്റു മെഷീൻ ലേണിംഗ് ടാസ്കുകൾക്കും രൂപകൽപന ചെയ്ത ശക്തമായ ലൈബ്രറിയാണ്. ഇതിന്റെ പ്രധാന പ്രത്യേകതകൾ ചുവടെ പറയുന്നവയാണ്:

  1. മുൻപേ പരിശീലിച്ച മോഡലുകൾ: ടെക്സ്റ്റ് ക്ലാസിഫിക്കേഷൻ, നാമം കാണിക്കൽ, ചോദ്യം-ഉത്തരവും, സംഗ്രഹവും, പരിഭാഷയും, ടെക്സ്റ്റ് നിർമ്മാണവും പോലുള്ള വിവിധ ജോലികൾക്കായി ആയിരക്കണക്കിന് മുൻകൂട്ടി പരിശീലിച്ച മോഡലുകൾ നൽകുന്നു.

  2. ഫ്രെയിംവർക്ക് ഇന്റർഓപ്പറബിലിറ്റി: PyTorch, TensorFlow, JAX തുടങ്ങിയ വിവിധ ഡീപ് ലേണിംഗ് ഫ്രെയിംവർക്കുകൾക്ക് പിന്തുണ നൽകുന്നു. ഇതിലൂടെ, ഒരു ഫ്രെയിംവർക്കിൽ മോഡൽ പരിശീലിപ്പിച്ച് മറ്റൊക്കെ ഉപയോഗിക്കാം.

  3. മൾട്ടി മൊഡൽ ശേഷികൾ: NLP-യ്ക്ക് പുറമേ, Hugging Face Transformers കമ്പ്യൂട്ടർ വിഷൻ (ഉദാ: ഇമേജ് ക്ലാസിഫിക്കേഷൻ, ഒബ്ജക്റ്റ് ഡിറ്റക്ഷൻ) ഓഡിയോ പ്രോസസിങ്ങിലും (ഉദാ: സ്പീച്ച് റെക്കഗ്നിഷൻ, ഓഡിയോ ക്ലാസിഫിക്കേഷൻ) പിന്തുണ നൽകിയിരിക്കുന്നു.

  4. ഉപയോഗത്തിൽ എളുപ്പം: മോഡലുകൾ ഡൗൺലോഡ് ചെയ്യാനും ഫൈൻ-ട്യൂൺ ചെയ്യാനും എളുപ്പമുള്ള API കളും ഉപകരണങ്ങളും നൽകുന്നു, തുടക്കക്കാരും വിദഗ്ധരുമായവർക്കും അനുകൂലമാണ്.

  5. സമൂഹവും വിഭവങ്ങളും: Hugging Face ഒരു സജീവമായ കമ്മ്യൂണിറ്റിയും സമ്പൂർണ്ണമായ ഡോക്യൂമെന്റേഷനും ട്യൂട്ടോരിയലുകളും ഗൈഡുകളും ഉള്ളവയാണ്, ഉപയോക്താക്കൾക്ക് ഇത് പ്രയോജനപ്പെടുത്തുന്നതിനു സഹായം നൽകുന്നു. ഔദ്യോഗിക ഡോക്യൂമെന്റേഷൻ അല്ലെങ്കിൽ അവരുടെ GitHub റീപോസ് കാണുക.

ഇതാണ് സാധാരണയായി ഉപയോഗിക്കുന്ന പരിശോധനാക്രമം, എന്നാൽ GPU ആക്സിലറേഷൻ ആവശ്യമുണ്ട്. ദൃശ്യപ്രക്രിയകൾക്കും MoE പോലെയുള്ള സാഹചര്യങ്ങൾക്കും അനേകം കണക്കുപക്രിയകൾ ആവശ്യമാണ്, ക്വാന്തൈസേഷൻ ഇല്ലാത്തെങ്കിൽ CPU-യിൽ ഇത് വളരെ ലംഘിതമാകും.

  • ഡെമോ: Transformer ഉപയോഗിച്ച് Phi-3.5-Instruct-നെ കോൾ ചെയ്യുക Click this link

  • ഡെമോ: Transformer ഉപയോഗിച്ച് Phi-3.5-Vision കോൾ ചെയ്യുക Click this link

  • ഡെമോ: Transformer ഉപയോഗിച്ച് Phi-3.5-MoE കോൾ ചെയ്യുക Click this link

Ollama Ollama നിങ്ങളുടെ യന്ത്രത്തിലുണ്ടായിരിക്കാൻ സ്വതന്ത്രമായ രീതിയിൽ വലിയ ഭാഷാ മോഡലുകൾ (LLM) പ്രവർത്തിപ്പിക്കാൻ രൂപകൽപ്പന ചെയ്ത ഒരു പ്ലാറ്റ്ഫോം ആണ്. Llama 3.1, Phi 3, Mistral, Gemma 2 എന്നിവ പോലുള്ള വിവിധ മോഡലുകൾ Ollama പിന്തുണയ്ക്കുന്നു. മോഡൽ വെയിറ്റുകൾ, കോൺഫിഗറേഷൻ, ഡാറ്റ എന്നിവ ഒരു പാക്കേജിൽ പാക്കുചെയ്‌തുകൊണ്ട് ഉപയോക്താക്കൾക്ക് മോഡലുകൾ സ്വയം ക്രമീകരിക്കാനും സൃഷ്ടിക്കാനും കൂടുതൽ എളുപ്പമാണ്. macOS, Linux, Windows എന്നിവയ്‌ക്കൊപ്പം ലഭ്യമാണ്. ക്ലൗഡ് സേവനങ്ങളിൽ ആശ്രയപ്പെടാതെ LLM സർവീസുകൾ പരീക്ഷിക്കാന്‍ അല്ലെങ്കിൽ വിന്യസിപ്പിക്കാൻ ഒരുപാട് സഹായിക്കുന്ന ഉപകരണമാണ്. Ollama ഏറ്റവും നേരിട്ടുള്ള മാർഗമാണ്, താഴെ കാണുന്ന കമാൻഡ് എക്സിക്യൂട്ട് ചെയ്യുക.

ollama run phi3.5

Foundry Local

Foundry Local Microsoft-ന്റെ ഓഫ്‌ലൈൻ, ഉപകരണത്തിൽ പ്രവർത്തിക്കുന്ന റൺടൈം ആണ്, Phi പോലുള്ള മോഡലുകൾ മുഴുവനായും നിങ്ങളുടെ സ്വന്തം ഹാർഡ്‌വെയർൽ പ്രവർത്തിപ്പിക്കാൻ - Azure സബ്‌സ്‌ക്രിപ്ഷൻ, API കീ അല്ലെങ്കിൽ നെറ്റ്‌വർക്ക് കണക്ഷൻ ആവശ്യമില്ല. അത് സ്വയം ഏറ്റവും മികച്ച എക്സിക്യൂഷൻ പ്രൊവൈഡർ (NPU, GPU, CPU) സ്വീകരിക്കുകയും OpenAI- അനുയോജ്യമായ എന്റ്‌പോയിന്റ് തുറക്കുകയും ചെയ്യുന്നു, അതുകൊണ്ട് നിലവിലുള്ള openai/Azure AI Inference SDK കോഡ് വളരെ കുറഞ്ഞ മാറ്റങ്ങളോടെ അതിലേക്കു പോയിന്റ് ചെയ്യാം. ആരംഭിക്കാൻ Foundry Local ഡോക്യുമെന്റേഷൻ കാണുക.

winget install Microsoft.FoundryLocal
foundry model run phi-3.5-mini

അല്ലെങ്കിൽ Python-ൽ നേരിട്ട് SDK ഉപയോഗിക്കുക:

pip install foundry-local-sdk
from foundry_local import FoundryLocalManager

manager = FoundryLocalManager("phi-3.5-mini")
print(manager.endpoint, manager.api_key)

GenAI-ക്കുള്ള ONNX റൺടൈം

ONNX Runtime ക്രോസ്-പ്ലാറ്റ്ഫോം ഇൻഫറൻസ്, ട്രെയ്‌നിംഗ് മെഷീൻ ലേണിംഗ് ആക്‌സിലറേറ്റർ ആണ്. Generative AI (GENAI)-ക്കുള്ള ONNX റൺടൈം വിവിധ പ്ലാറ്റ്ഫോമുകളിൽ ജനനാത്മക AI മോഡലുകൾ കാര്യക്ഷമമായി പ്രവർത്തിപ്പിക്കാൻ സഹായിക്കുന്ന ശക്തമായ ഉപകരണമാണ്.

ONNX റൺടൈം എന്താണ്?

ONNX റൺടൈം ഒരു ഓപ്പൺ സോഴ്‌സ് പ്രോജക്ടാണ്, മെഷീൻ ലേണിംഗ് മോഡലുകളുടെ ഉയർന്ന പ്രകടന ഇൻഫറൻസ് സൗകര്യം വാഗ്ദാനം ചെയ്യുന്നു. Open Neural Network Exchange (ONNX) ഫോർമാറ്റിലുള്ള മോഡലുകൾക്ക് പിന്തുണ നൽകുന്നു, ഇത് മെഷീൻ ലേണിംഗ് മോഡലുകൾ പ്രതിനിധാനം ചെയ്യാനുള്ള സ്റ്റാൻഡേർഡാണ്. ONNX റൺടൈം ഇൻഫറൻസ് വേഗത്തിൽ ഉപഭോക്തൃ അനുഭവം മെച്ചപ്പെടുത്തുകയും ചെലവുകൾ കുറക്കുകയും ചെയ്യുന്നു, PyTorch, TensorFlow/Keras പോലുള്ള ഡീപ് ലേണിംഗ് ഫ്രെയിംവർക്കുകളും scikit-learn, LightGBM, XGBoost പോലുള്ള പാരമ്പര്യ മെഷീൻ ലേണിംഗ് ലൈബ്രറികളും പിന്തുണയ്ക്കുന്നു. ONNX റൺടൈം വിവിധ ഹാർഡ്‌വെയറുകൾ, ഡ്രൈവർകൾ, ഓപ്പറേറ്റിംഗ് സിസ്റ്റങ്ങൾക്കൊപ്പം സൗകര്യപ്രദം, ഹാർഡ്‌വെയർ ആക്‌സിലറേറ്ററുകൾ ഉപയോഗിച്ച് വ്യാപക പ്രകടനം ഉത്പാദിപ്പിക്കാൻ ഗ്രാഫ് ഓപ്റ്റിമൈസേഷനും ട്രാൻസ്ഫോമുകളും ഉപയോഗിക്കുന്നു.

ജനനാത്മക AI എന്താണ്?

ജനനാത്മക AI സിസ്റ്റങ്ങൾ പരിശീലിപ്പിച്ച ഡാറ്റയുടെ അടിസ്ഥാനത്തിൽ പുതിയ ഉള്ളടക്കം സൃഷ്ടിക്കാൻ (ടെക്സ്റ്റ്, ചിത്രം, സംഗീതം തുടങ്ങിയവ) കഴിയുന്ന AI സിസ്റ്റങ്ങൾക്കാണ് സൂചന. ഉദാഹരണമായി GPT-3 പോലുള്ള ഭാഷാമോഡലുകളും Stable Diffusion പോലുള്ള ചിത്രം സൃഷ്ടിക്കൽ മോഡലുകളും ഉൾപ്പെടുന്നു. ONNX റൺടൈം GENAI ലൈബ്രറി ONNX മോഡലുകൾക്കായുള്ള ജനനാത്മക AI ചക്രം നൽകുന്നു, ഇതിൽ ഇൻഫറൻസ്, ലോജിറ്റ് പ്രോസസ്സിംഗ്, സെർച്ച് & സാമ്പ്ലിങ്, KV കാഷെ മാനേജ്മെന്റ് എന്നിവ ഉൾപ്പെട്ടിരിക്കുന്നു.

GENAI-ക്കുള്ള ONNX റൺടൈം

GENAI-ക്കുള്ള ONNX റൺടൈം ONNX റൺടൈമിന്റെ ശേഷികളെ വിപുലീകരിച്ച് ജനനാത്മക AI മോഡലുകൾക്ക് പിന്തുണ നൽകുന്നു. ഇതിന്റെ പ്രധാന സവിശേഷതകൾ ചുവടെ പറഞ്ഞു തരുന്നു:

  • വ്യാപകമായ പ്ലാറ്റ്ഫോം പിന്തുണ: Windows, Linux, macOS, Android, iOS എന്നിവ ഉൾപ്പെടെ പല പ്ലാറ്റ്ഫോമുകളിലും പ്രവർത്തിക്കുന്നു.
  • മോഡൽ പിന്തുണ: LLaMA, GPT-Neo, BLOOM മുതലായ ജനപ്രിയ ജനനാത്മക AI മോഡലുകൾക്ക് പിന്തുണ നൽകുന്നു.
  • പ്രകടന മെച്ചപ്പെടുത്തൽ: NVIDIA GPUs, AMD GPUs തുടങ്ങിയവ ഉൾപ്പെടെ വ്യത്യസ്ത ഹാർഡ്‌വെയർ ആക്‌സിലറേറ്ററുകൾക്കായി ഓപ്റ്റിമൈസേഷനുകൾ ഉൾപ്പെടുത്തിയിരിക്കുന്നു.
  • ഉപയോഗത്തിൽ എളുപ്പം: കൂട്ടിയിണയ്ക്കുന്നതിന് എളുപ്പമുള്ള API കളിലൂടെ, കുറഞ്ഞ കോഡുമായി ടെക്സ്റ്റ്, ചിത്രങ്ങൾ, മറ്റ് ഉള്ളടക്കങ്ങൾ സൃഷ്ടിക്കാൻ കഴിയും.
  • ഉപയോക്താക്കൾ ഉയർന്നതല generate() മെത്തോഡ് കോൾ ചെയ്യാം లేదా മോഡലിന്റെ ഒരു ഘട്ടം ഘട്ടമായി ഓടിച്ച്, ഓരോ ടോക്കൺ ഒന്നു ഒരുകൂട്ടത്തോടെ സൃഷ്ടിച്ചും വേണ്ടെങ്കിൽ ജനറേഷൻ പരാമീറ്ററുകൾ ലൂപ്പിനുള്ളിൽ അപ്ഡേറ്റ് ചെയ്തും പോകാം.
  • ONNX റൺടൈമിന് ഗ്രീഡി/ബീം സർച്ച് പിന്തുണയും TopP, TopK സാമ്പ്ലിങും ടോക്കൺ സീക്വൻസുകൾ സൃഷ്ടിക്കാൻ, ആവർത്തന ശിക്ഷകൾ പോലുള്ള ലോജിറ്റ് പ്രോസസ്സിംഗും ഉൾപ്പെട്ടിട്ടുണ്ട്. കസ്റ്റം സ്കോറിങ്ങും എളുപ്പത്തിൽ ചേർക്കാം.

ആരംഭിക്കൽ

GENAI-ക്കുള്ള ONNX റൺടൈം ഉപയോഗിക്കാനായി, നിങ്ങൾക്ക് താഴെ പറയുന്നവ ചെയ്യാം:

ONNX റൺടൈം ഇൻസ്റ്റാൾ ചെയ്യുക:

pip install onnxruntime

ജനനാത്മക AI എക്സ്റ്റൻഷനുകൾ ഇൻസ്റ്റാൾ ചെയ്യുക:

pip install onnxruntime-genai

മോഡൽ ഓടിക്കുക: Python ലെ ഒരു ലളിതമായ ഉദാഹരണം ഇവിടെ:

import onnxruntime_genai as og

model = og.Model('path_to_your_model.onnx')

tokenizer = og.Tokenizer(model)

input_text = "Hello, how are you?"

input_tokens = tokenizer.encode(input_text)

output_tokens = model.generate(input_tokens)

output_text = tokenizer.decode(output_tokens)

print(output_text) 

ഡെമോ: ONNX റൺടൈം GenAI ഉപയോഗിച്ച് Phi-3.5-Vision കോൾ ചെയ്യൽ

import onnxruntime_genai as og

model_path = './Your Phi-3.5-vision-instruct ONNX Path'

img_path = './Your Image Path'

model = og.Model(model_path)

processor = model.create_multimodal_processor()

tokenizer_stream = processor.create_stream()

text = "Your Prompt"

prompt = "<|user|>\n"

prompt += "<|image_1|>\n"

prompt += f"{text}<|end|>\n"

prompt += "<|assistant|>\n"

image = og.Images.open(img_path)

inputs = processor(prompt, images=image)

params = og.GeneratorParams(model)

params.set_inputs(inputs)

params.set_search_options(max_length=3072)

generator = og.Generator(model, params)

while not generator.is_done():

    generator.compute_logits()
    
    generator.generate_next_token()

    new_token = generator.get_next_tokens()[0]
    
    output = tokenizer_stream.decode(new_token)
    
    print(tokenizer_stream.decode(new_token), end='', flush=True)

മറ്റുള്ളവ

ONNX റൺടൈം, Ollama, Foundry Local റഫറൻസ് രീതികളിനൊപ്പം തന്നെ വ്യത്യസ്ത നിർമ്മാതാക്കൾ നൽകിയ മോഡൽ റഫറൻസ് രീതികളിലെ അടിസ്ഥാനമാക്കി ക്വാണ്ടിറ്റേറ്റീവ് മോഡലുകളുടെ റഫറൻസ് നാം പൂർത്തിയാക്കാം. ഉദാഹരണത്തിന് Apple MLX ഫ്രെയിംവർക്ക് Apple Metal, Qualcomm QNN NPU, Intel OpenVINO CPU/GPU തുടങ്ങിയവ. കൂടുതൽ ഉള്ളടക്കം Phi-3 Cookbook ൽ ലഭ്യമാണ്.

കൂടുതൽ

Phi-3/3.5 കുടുംബത്തിന്റെ അടിസ്ഥാനങ്ങൾ നാം പഠിച്ചു, എന്നാൽ SLMപ്പുറമേ കൂടുതലറിയാൻ കൂടുതൽ അറിവ് ആവശ്യമാണ്. ഉത്തരങ്ങൾ കണ്ടെത്താൻ Phi-3 Cookbook കാണുക. കൂടുതൽ അറിയാൻ ആഗ്രഹിക്കുന്നവർ Phi-3 Cookbook സന്ദർശിക്കുക.


അറിയിപ്പ്: ഈ രേഖ AI പരിഭാഷാ സേവനം Co-op Translator ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല.