वेक्टर एम्बेडिंग: स्मार्ट RAG शोध टिपा

2010 मध्ये शोध इंजिनला “स्वस्त मोबाईल फोन” साठी विचारणारे चित्र, आणि ते मुळात शून्य कल्पनेसह ते अचूक शब्द शोधते. मग तुम्ही तेच पुन्हा विचारता, आता 2026 मध्ये, आणि ते केवळ “बजेट स्मार्टफोन” किंवा “परवडणारे Android” म्हणणारी सामग्रीच मिळवत नाही तर “$200 अंतर्गत फोन” सारखी पृष्ठे शोधण्यासाठी देखील कार्य करते जिथे त्या अटी कुठेही दिसत नाहीत! परंतु तुम्ही पहा, कोणीही त्यांना “समानार्थी” किंवा तत्सम काहीही समजण्यासाठी स्पष्टपणे प्रशिक्षित केले नाही. हे भूमिती आणि अशाप्रकारे समानता, क्रमवारी, शोधून काढते.

वेक्टर एम्बेडिंग आधुनिक शोध इंजिनांना कीवर्ड जुळण्यापेक्षा खूप पुढे जाण्याची परवानगी द्या. हे लोक सहसा विचार करतात त्यापेक्षा बरेच काही महत्त्वाचे आहे, कारण ते केवळ शोधपुरते मर्यादित नाही. शिफारशींखालील शांत प्लंबिंग, तुमच्या कंपनीच्या कागदपत्रांचा वापर करून उत्तरे देणारे चॅटबॉट्स आणि आजकाल लोकांना 'एआय समजून' म्हणून जे काही कळले आहे ते हे आहे.

एम्बेडिंग म्हणजे काय?

फॅन्सी शब्द काढून टाकणे, एम्बेड करणे म्हणजे फक्त संख्यांची यादी. न्यूरल नेटवर्क प्रमाणेच, ते इनपुट घेते, मग ते शब्द, वाक्य, फोटो किंवा संपूर्ण दस्तऐवज असो, आणि त्याच्या विरुद्ध व्हेक्टर आउटपुट करते (सामान्यतः कुठेतरी सुमारे 256 ते 3,072 संख्या, द्या किंवा घ्या). ते वेक्टर म्हणजे काही गणिताच्या जागेत तुमच्या इनपुटची स्थिती.

महत्त्वाचा भाग म्हणजे ती जागा कशी शिकली जाते. प्रशिक्षणादरम्यान, मॉडेल “समान अर्थ” एकमेकांच्या जवळ ठेवण्यामध्ये अधिक चांगले होते, तर “वेगळा अर्थ” अधिक दूर होतो. मी येथे समान शुद्धलेखनाबद्दल बोलत नाही; मला समान अर्थ आहे.

  • “कुत्रा” आणि “पिल्लू” एकमेकांजवळ उतरतात.
  • “कुत्रा” आणि “कॅनाइन” देखील एकमेकांजवळ उतरतात, जरी त्यांच्यात अक्षरे नसली तरीही.
  • दरम्यान, “कुत्रा” आणि “स्टॉक मार्केट” खूप दूर आहेत, अजिबात जवळ नाहीत.
अधिकृत प्रतिमेवर आधारित प्रातिनिधिक प्रतिमा | बातम्या

अर्थाची जटिलता

“क्लोज” म्हणजे काय हे ठरवण्यासाठी, या प्रणाली काही सामान्य उपाय वापरतात, जसे की कोसाइन समानता, जो वेक्टर, बिंदू उत्पादन किंवा युक्लिडियन अंतर यांच्यातील कोन आहे. कोसाइन समानता अतिशय सामान्य आहे कारण ती दिशेवर लक्ष केंद्रित करते आणि परिमाणावर नाही, जे दीर्घ दस्तऐवज वेक्टरसह शॉर्ट क्वेरी वेक्टरची तुलना करताना मदत करते.

तीन जॉब्स वेक्टर एम्बेडिंग करतात

(एकच मूळ कल्पना पण भिन्न परिणामांसह.)

  1. शब्दार्थ शोध: कीवर्ड जुळण्याऐवजी, तुम्ही वापरकर्ता क्वेरी एम्बेड करा आणि प्रत्येक दस्तऐवज त्याच्यासह निर्देशांकात एम्बेड करा. मग तुम्ही कागदपत्रे मागे खेचता ज्यांचे वेक्टर क्वेरीच्या वेक्टरच्या सर्वात जवळ आहेत. अशा प्रकारे, टायपो, समानार्थी शब्द आणि अस्पष्ट वाक्यांशांसह शोध कमी ठिसूळ होतो, जुन्या-शाळेतील कीवर्ड जुळण्यापेक्षा चांगले.
  2. शिफारसी: हीच एम्बेडिंग प्रक्रिया उत्पादने, संगीत आणि लेखांसाठी वापरली जाते. जर तुमची क्रिया वेक्टर स्पेसमधील ठराविक बिंदूंजवळ उतरत असेल, तर सिस्टीम जवळपास असलेल्या इतर वस्तू सुचवते. समान भूमिती वापरून, शोध “स्वाद” च्या प्रदेशात हलविला जातो.
  3. पुनर्प्राप्ती-संवर्धित जनरेशन (RAG): इथेच एम्बेडिंग्ज LLM सह गुंफतात. LLM ला जादुईपणे सर्व काही कळेल असे गृहीत धरण्याऐवजी (अर्थातच तसे नाही; ते काही कटऑफवर गोठलेले आहे, आणि ते आपोआप तुमच्या अंतर्गत दस्तऐवजांना कळणार नाही), एक RAG प्रणाली:
  • कागदपत्रांचे लहान तुकडे करतो
  • प्रत्येक भाग एम्बेड करतो आणि वेक्टर डेटाबेसमध्ये वेक्टर संग्रहित करतो
  • वापरकर्ता प्रश्न त्याच प्रकारे एम्बेड करतो
  • सर्वात समान भाग पकडतो
  • उत्तर देण्यापूर्वी ते भाग LLM मध्ये संदर्भ म्हणून पाठवते

दुसऱ्या शब्दांत, LLM ला तुमची कागदपत्रे आठवत नाहीत, कारण ती त्यात सक्षम नाही. हे रनटाइममध्ये सर्वात संबंधित तुकडे मिळवत आहे; लुकअप सारखे, ते बोलण्यापूर्वी.

विश्वासार्हतेची श्रेणी

बहुतेक मार्गदर्शक हे वगळतात, परंतु मी हा भाग समाविष्ट करेन, वास्तविक उत्पादन प्रणालींसाठी, ही मोठी सामग्री आहे.

नियम एक (पर्यायी नाही): तुमचे दस्तऐवज एम्बेड करण्यासाठी वापरलेले मॉडेल हे क्वेरी एम्बेड करण्यासाठी वापरलेले मॉडेल असावे. तुम्ही भिन्न एम्बेडिंग मॉडेल्स वापरत असल्यास, तुम्ही पूर्णपणे विसंगत स्पेसमध्ये वेक्टरसह समाप्त कराल, जे मुळात निरर्थक परिणाम देतात.

आणि समजून घ्या की हा नियम काहीतरी वेदनादायक सूचित करतो. तुम्ही एम्बेडिंग मॉडेल्स नंतर कधीही स्विच केल्यास, तुम्ही तुमचा जुना वेक्टर डेटाबेस ठेवू शकत नाही. आपल्याला सुरुवातीपासून सर्वकाही पुन्हा एम्बेड करण्याची आवश्यकता आहे. सर्व काही.

त्यानंतर, तीन सामान्य अयशस्वी मोड आहेत जे “माझे RAG भ्रमित का आहे?” तिकिटे

  • खराब चंकिंग: जर तुम्ही विचित्र सीमारेषेवर विभक्त झालात, तर तुम्ही एक वाक्य त्याच्या संदर्भापासून वेगळे करू शकता. त्यानंतर तुम्हाला एक भाग मिळेल जो आमच्या वेक्टर अर्थाने तांत्रिकदृष्ट्या संबंधित वाटू शकतो, परंतु व्यवहारात निरुपयोगी आहे.
  • जुन्या निर्देशांक: तुमचे दस्तऐवज बदलतात. परंतु वेक्टर डेटाबेस स्वतःला जादुई रिफ्रेश करत नाहीत. त्यामुळे तुम्ही जुनी तथ्ये परत मिळवू शकता. जोपर्यंत कोणी तपासत नाही तोपर्यंत ते ठीक दिसू शकते.
  • आयाम जुळत नाही: काही एम्बेडिंग मॉडेल्स व्हेरिएबल-लेंथ व्हेक्टर किंवा भिन्न निश्चित आकार आउटपुट करतात. जर तुम्ही 1536-डायमेंशन व्हेक्टरची 768-डायमेंशन वेक्टरशी तुलना केली, तर ती सरळ होणार नाही. आपण ते देखील बंद करू शकत नाही.

तसेच, येथे एक सावधानता आहे! खराब एम्बेडिंग मॉडेल अनेकदा घोषित त्रुटीशिवाय अयशस्वी होते. हे प्रशंसनीय परंतु चुकीचे भाग पुनर्प्राप्त करते, आणि नंतर LLM चुकीचे उत्तर एकत्र करते… ज्याला आपण भ्रम म्हणून परिचित आहोत, त्याचा दोष LLM वर येतो, तर खरा गुन्हेगार एम्बेडिंग लेयर होता.

नंतर पश्चात्ताप न करता एम्बेडिंग मॉडेल निवडणे

एम्बेडिंग मॉडेल इकोसिस्टम निश्चितपणे अलीकडेच फिरले आहे. मुक्त-स्रोत मॉडेल्स आता MTEB सारख्या कच्च्या पुनर्प्राप्ती बेंचमार्कवर बंद APIsशी जुळतात किंवा त्यांना हरवतात, आणि ती शिफ्ट जवळजवळ दीड वर्षापूर्वीही घडत नव्हती.

मॉडेल उल्लेखनीय वैशिष्ट्य संदर्भ विंडो / मंद
BGE-M3 स्वयं-होस्टेड, बहुभाषिक उत्पादन मॉडेल 8,192 टोकन / 1,024-d
OpenAI मजकूर-एम्बेडिंग-3-मोठा मजबूत सामान्य कामगिरी, समाकलित करणे सर्वात सोपे 8,191 टोकन / 3,072-d
मिथुन एम्बेडिंग विस्तारित टोकन श्रेणींमध्ये मल्टीमोडल समर्थन 32,768 टोकन / 3,072-d पर्यंत
Qwen3-एम्बेडिंग-8B MTEB पुनर्प्राप्ती बेंचमार्कचे नेतृत्व करते ३२,७६८ टोकन / ४,०९६-डी

बऱ्याच RAG सेटअपमध्ये असे आढळून आले आहे की 768 ते 1024 परिमाणे अचूकता आणि किंमत यांच्यातील गोड जागा आहेत आणि मोठे जाणे सामान्यतः प्रमाणात मिळत नाही. एक युक्ती असली तरी ती खरोखरच बिल कमी करू शकते.

स्टोरेजची किंमत 4x कमी करणारी युक्ती

अलीकडची एक गोष्ट लोकांना माहित असली पाहिजे ती म्हणजे मॅट्रीओष्का रिप्रेझेंटेशन लर्निंग, ज्याचे नाव त्या घरट्याच्या बाहुल्यांच्या नावावर ठेवले गेले आहे (कारण कल्पना अशी आहे की आपण मॉडेलला अगदी सुरुवातीस सर्वात उपयुक्त अर्थपूर्ण माहिती भरण्यास शिकवता), जसे की वेक्टरच्या पहिल्या परिमाणांप्रमाणे.

वेक्टर एम्बेडिंग्ज
अधिकृत प्रतिमेवर आधारित प्रातिनिधिक प्रतिमा | बातम्या

ज्याचा अर्थ असा आहे की तुम्ही 1024-d एम्बेडिंग घेऊ शकता आणि ते 256 मितींपर्यंत कमी करू शकता आणि कदाचित 2-3% पुनर्प्राप्ती अचूकता गमावू शकता. दरम्यान, तुमचा स्टोरेज आणि शोध खर्च 4x ने कमी झाला! वास्तविक स्केलवर वेक्टर शोध करणाऱ्या संघांसाठी, हे लहान ऑप्टिमायझेशनपेक्षा बरेच काही आहे. ही एक कायदेशीर पायाभूत सुविधा निवड आहे.

वास्तविक टेकअवे

उत्पादन स्लाइडवर “1024 क्रमांकांची ही यादी” छान दिसणार नाही. तर, एम्बेडिंग हे एआय सिस्टीमचा भाग आहेत ज्यांना कोणीही डेमो करत नाही. परंतु बहुतेक संघ कबूल करतात त्यापेक्षा ते बरेच काही वास्तविक विचार करत आहेत.

तुम्हाला एम्बेडिंग लेयर बरोबर मिळाल्यास, मॉडेलची निवड तुम्ही प्रशिक्षित केलेल्या गोष्टींशी जुळत असल्याची खात्री करा, समजूतदार चंकिंग वापरा, एक नवीन अनुक्रमणिका तयार करा, नंतर शोधा, शिफारसी आणि RAG ते जसे वागायला हवे तसे वागू लागतील. गडबड करा, आणि LLM बाजूने कितीही प्रॉम्प्ट टिंकरिंग तुम्हाला वाचवू शकत नाही, कारण सिस्टमला आधीपासून चुकीचा संदर्भ मिळाला आहे.

Comments are closed.