Pe scurt
RAG combină recuperarea unor fragmente din surse controlate cu generarea unui răspuns de către un model. Merită când informația se află în documente care se schimbă, răspunsul trebuie să citeze sursa și accesul poate fi controlat; nu elimină erorile și nu înlocuiește guvernanța documentelor.
Ce este RAG
Retrieval-Augmented Generation (RAG) este o arhitectură în care sistemul caută informație relevantă într-o colecție externă și o oferă modelului ca context pentru răspuns. Lucrarea lui Lewis și coautorii a formulat RAG ca o combinație între memoria parametrică a modelului și o memorie non-parametrică recuperată. Implementările enterprise de astăzi adaugă parsare, permisiuni, citări, reranking, evaluare și monitorizare.
RAG nu «învață» automat documentele în parametrii modelului. La fiecare întrebare, aplicația caută fragmente și construiește contextul. Acest lucru face actualizarea mai ușoară decât reantrenarea, dar introduce erori noi: documentul poate fi ratat, fragmentul poate fi nepotrivit sau modelul poate răspunde dincolo de sursă.
RAG versus chatbot, search și fine-tuning
| Abordare | Punct forte | Limită | Când o alegi |
|---|---|---|---|
| Chatbot general | Conversație și cunoștințe generale | Nu cunoaște sursele interne actuale | Sarcini fără informații proprietare |
| Search clasic | Rezultate exacte și navigare | Utilizatorul sintetizează | Documente bine indexate și nevoie de control |
| RAG | Răspuns cu surse actualizabile | Retrieval și generare pot greși | Întrebări pe documente multiple |
| Fine-tuning | Stil sau comportament repetabil | Nu este baza ideală pentru fapte mereu actuale | Format, clasificare sau policy de răspuns |
Search și RAG pot coexista: utilizatorul vede răspunsul, fragmentele și lista de rezultate. Fine-tuning-ul poate standardiza comportamentul, dar nu înlocuiește sursa verificabilă. Pentru întrebări cu răspuns exact într-o bază de date, o interogare structurată poate fi mai sigură decât RAG.
Use cases potrivite
- Politici și proceduri interne cu versiuni și owner.
- Documentație de produs și manuale tehnice.
- Clauze și obligații din contracte, cu review juridic pentru interpretare.
- Knowledge base pentru customer support.
- Sales enablement din materiale aprobate.
- Căutare în rapoarte, studii și arhive cu drepturi clare.
Când RAG nu este potrivit
Nu folosi RAG ca sistem de evidență pentru solduri, inventar sau statusuri care trebuie citite exact dintr-o bază de date. Evită-l când documentele nu au owner, permisiunile nu pot fi păstrate sau răspunsul trebuie să reprezinte o decizie profesională finală. Dacă utilizatorul are nevoie doar de documentul potrivit, search poate fi mai simplu și mai transparent.
Arhitectura RAG, de la sursă la răspuns
Alternativă textuală: documentele autorizate sunt prelucrate, indexate și recuperate pentru identitatea utilizatorului; modelul răspunde din fragmentele permise, apoi sistemul verifică și monitorizează rezultatul.
- Conectează sursele aprobate și preia documentul, versiunea, ownerul și permisiunile.
- Parsează conținutul, elimină zgomotul și păstrează structura utilă.
- Împarte în fragmente, adaugă metadata și generează reprezentări pentru căutare.
- La întrebare, autentifică utilizatorul și aplică filtrele de permisiuni.
- Recuperează, rerankează și construiește un context limitat și citabil.
- Generează răspunsul, validează citările, aplică refuzul și înregistrează evaluarea.
Pregătirea surselor
Inventariază depozitele, formatele, proprietarii și ciclul de viață. Decide ce documente sunt autoritative și ce conținut nu trebuie indexat. Un folder partajat nu este o taxonomie. Duplicatele și versiunile vechi trebuie marcate sau excluse înainte ca sistemul să le transforme în răspunsuri fluente.
Parsing, chunking și metadata
Parserul trebuie să păstreze titluri, tabele, liste, pagini și relația cu fișierul. Chunking-ul nu are o dimensiune universală: un fragment prea mic pierde contextul, unul prea mare diluează semnalul și costă. Testează pe întrebările reale. Metadata minimă include sursa, versiunea, secțiunea, data, ownerul, limbajul și permisiunile.
| Câmp | Cerință |
|---|---|
| document_id | Stabil și unic între versiuni |
| source_url | Adresă accesibilă utilizatorului autorizat |
| version / effective_date | Versiune și dată de intrare în vigoare |
| owner | Persoană sau funcție responsabilă |
| heading_path | Ierarhia secțiunii |
| permissions | Utilizatori, grupuri sau reguli moștenite |
| checksum | Detectarea schimbărilor |
| deleted_at | Propagarea eliminării |
Embeddings, retrieval și reranking
Embeddings reprezintă semantic fragmentele și întrebarea pentru a aproxima similitudinea. Căutarea hibridă combină frecvent semnal semantic cu termeni exacți, utili pentru coduri, clauze sau nume. Reranking-ul reordonează un set de candidați cu un model suplimentar. Fiecare etapă trebuie evaluată separat.
Documentația OpenAI Vector Stores arată un exemplu furnizor-specific de chunking și semantic search. Nu copia valorile implicite ca standard. Furnizorul, limba română, structura documentelor și întrebările pot cere altă strategie.
Construirea contextului și generarea
Contextul trebuie să conțină suficiente fragmente pentru răspuns, dar nu documente întregi fără nevoie. Include delimitatori, identitatea sursei și instrucțiunea de a refuza când informația lipsește. Tratează textul recuperat ca date neîncrezătoare: un document poate conține instrucțiuni malițioase de tip prompt injection.
Citări verificabile
O citare bună deschide documentul și secțiunea pe care utilizatorul are dreptul să o vadă. Verifică programatic dacă afirmația este susținută de fragment, nu doar dacă modelul a tipărit un ID. Pentru răspunsuri care combină surse, asociază fiecare afirmație importantă cu sursa corespunzătoare.
Acces la nivel de document
Autentificarea aplicației nu este suficientă; retrieval-ul trebuie să filtreze după utilizator și grupuri înainte de a trimite fragmente modelului. Azure AI Search documentează mecanisme de security filters și funcții ACL/RBAC, unele încă preview în 2026. Indiferent de produs, testează sincronizarea permisiunilor și comportamentul fail-closed.
| Control | Test |
|---|---|
| Autentificare | Utilizator absent sau token expirat este respins |
| Filtrare | Un grup nu vede documentele altui grup |
| Moștenire | Schimbarea permisiunii ajunge în index |
| Ștergere | Documentul dispare din retrieval și cache |
| Citare | Linkul nu expune titlul ori conținutul neautorizat |
| Fail-closed | Eroarea sistemului de permisiuni nu returnează rezultate |
Freshness și documente șterse
Definește cât poate întârzia o actualizare și măsoară acest SLA. Păstrează versiunea activă, invalidează cache-ul și propagă ștergerea către fragmente, index, copii și evaluări unde este aplicabil. Un răspuns cu sursă veche trebuie fie marcat, fie refuzat.
Evaluarea retrieval-ului și răspunsului
| Nivel | Metrică | Întrebare |
|---|---|---|
| Retrieval | Recall@k | Fragmentul necesar apare între rezultate? |
| Ranking | MRR / evaluare umană | Sursa bună apare suficient de sus? |
| Răspuns | Corectitudine | Afirmațiile răspund întrebării? |
| Groundedness | Susținere în context | Fiecare fapt este în surse? |
| Citări | Precizie și acoperire | Linkul susține afirmația? |
| Refuz | Precizie refuz | Refuză când sursa lipsește? |
| Securitate | Acces și injection | Evită conținutul neautorizat/malițios? |
| Câmp | Conținut |
|---|---|
| question | Întrebare reală, inclusiv variante românești |
| user_context | Roluri și permisiuni simulate |
| expected_sources | Documente și pasaje relevante |
| required_facts | Afirmațiile necesare |
| forbidden_claims | Concluzii care nu sunt în surse |
| expected_action | Răspuns, clarificare sau refuz |
| risk | Impactul unei erori |
Monitorizare, cost și arhitectura pilotului
Monitorizează întrebări fără rezultat, surse vechi, citări invalide, acces respins, cost, latență și feedback. Nu păstra automat conținut sensibil în loguri. Costul include ingestia, embeddings, indexul, retrieval-ul, reranking-ul, modelul, evaluările și operarea, nu doar tokenii răspunsului.
- Alege o colecție cu owner, versiuni și permisiuni clare.
- Construiește 50–100 de întrebări reprezentative înainte de optimizare.
- Livrează search + răspuns + citări într-un grup restrâns.
- Testează accesul, ștergerea, injection, refuzul și fallback-ul.
- Măsoară retrieval-ul separat de generare și rezolvă veriga slabă.
- Extinde numai după checklistul de producție.
Exemplu ipotetic: asistent pentru proceduri
Exemplu ipotetic: o companie are 400 de proceduri în română și engleză, distribuite în două depozite. Pilotul include numai procedurile active ale unui departament. Fiecare document primește owner, versiune, dată efectivă și grupuri. Utilizatorul vede răspunsul, pasajele și linkul către sursă.
Setul de evaluare conține întrebări directe, combinații între proceduri, întrebări fără răspuns și utilizatori fără acces. Un răspuns fluent din documentul greșit este eșec. Un refuz corect pentru documentul neautorizat este succes, chiar dacă informația există în index pentru alt grup.
Teste de securitate specifice RAG
| Test | Rezultat așteptat |
|---|---|
| Instrucțiune malițioasă în document | Este tratată ca date, nu executată |
| Întrebare despre document neautorizat | Refuz fără divulgarea existenței/conținutului |
| Permisiune revocată | Documentul dispare în intervalul acceptat |
| Citare inventată | Validatorul respinge linkul sau pasajul inexistent |
| Query foarte lung / repetat | Limite de resurse și rate limiting |
| Document corupt | Ingestia eșuează controlat și alertează ownerul |
Alegerea stivei tehnice
Compară serviciile pe conectori, parsare, căutare hibridă, filtre, ACL, regiune, ștergere, observabilitate și portabilitate. O bază vectorială nu este întreaga soluție. Uneori motorul de search existent și o componentă de generare sunt suficiente; alteori produsul de knowledge management oferă deja permisiunile și auditul.
Păstrează o interfață de evaluare independentă de furnizor: aceeași întrebare, aceleași surse așteptate și aceeași rubrică. Astfel poți compara un model, retriever sau reranker nou fără a confunda schimbarea tehnică cu schimbarea datasetului.
Operarea conținutului
- Ownerii primesc raport de documente expirate sau fără dată.
- Modificările critice declanșează reindexare și teste de regresie.
- Întrebările fără răspuns intră într-un backlog editorial, nu direct în prompt.
- Documentele duplicate sunt consolidate la sursă.
- Feedbackul utilizatorilor este validat înainte de a modifica sursele.
- Accesul și logurile sunt recertificate la intervalul stabilit.
Latență și cost pe răspuns valid
Măsoară separat timpul de autentificare, retrieval, reranking, generare și verificare. Un răspuns mai lung poate costa mai mult fără să fie mai util. Limitează top-k, contextul și răspunsul pe baza evaluărilor, nu doar pentru a reduce factura.
Costul corect este costul per răspuns valid: include ingestia amortizată, indexul, modelele, retry-urile, evaluarea, monitorizarea și review-ul. Dacă o cerere eșuează și este reluată de trei ori, toate apelurile aparțin aceluiași rezultat. Compară și cu search fără generare.
Întrebări multilingve și româna
Testează documente și întrebări în limbi diferite, diacritice, abrevieri și terminologie internă. Decide dacă retrieval-ul caută cross-lingual sau traduce întrebarea și cum păstrează citarea originală. O traducere fluentă nu trebuie să modifice termenii contractuali ori procedurali.
Limitări
RAG nu garantează adevărul, completitudinea sau confidențialitatea. Acestea depind de documente, arhitectură, permisiuni și operare. Nu îl folosi ca substitut pentru consultanță profesională, baze de date tranzacționale sau aprobări. Pentru selecția între produs și dezvoltare, folosește ghidul build versus buy, iar pentru suport vezi chatbot, copilot sau agent.
Resurse pentru pasul următor
Aplică acest cadru într-o situație reală
Implementare AI pentru companii
Serviciul principal asociat cadrului din acest ghid.
Studiul de caz UserCompass
Vezi cum a fost aplicată abordarea într-un produs real.
Radar Business AI
Folosește resursa gratuită pentru primul diagnostic.
AI pentru Customer Support în Limba Română: Chatbot, Copilot sau Agent?
Continuă cu o metodologie complementară.
De la Pilot AI la Producție: Evaluare, Securitate, Monitorizare și Adopție
Continuă cu o metodologie complementară.
Prețuri și forme de colaborare
Vezi opțiunile publice de lucru cu NextChapter.
Discută cu echipa
Clarifică problema și următorul pas potrivit.
Scris deVlad CovaciFondator & Partener Produs și TehnologieÎntrebări frecvente
- RAG înseamnă că modelul este antrenat pe documentele firmei?
- De regulă, nu. Documentele sunt indexate și fragmentele relevante sunt trimise ca context la fiecare întrebare. Fine-tuning-ul este un mecanism diferit.
- RAG elimină halucinațiile?
- Nu. Poate îmbunătăți ancorarea și citarea, dar retrieval-ul, ranking-ul și generarea pot greși. Sunt necesare evaluare și refuz.
- Pot indexa toate documentele din companie?
- Nu este recomandat. Include numai surse cu scop, owner, versiune și permisiuni clare. Respectă accesul și ștergerea.
- Când aleg search fără generare?
- Când utilizatorul are nevoie de documentul exact, riscul unei sinteze este mare sau răspunsul trebuie verificat integral la sursă.
- Cum testez RAG în română?
- Folosește întrebări reale cu diacritice, fără diacritice, sinonime, termeni interni, întrebări fără răspuns și utilizatori cu permisiuni diferite.
Termeni cheie din acest ghid
- RAG — Retrieval-Augmented Generation — RAG (Retrieval-Augmented Generation) este o tehnică AI care combină un motor de căutare în documente proprii cu un LLM, permițând modelului să răspundă pe baza informațiilor specifice ale companiei tale.
- Embeddings — Embeddings sunt reprezentări numerice folosite pentru a aproxima relațiile semantice dintre texte, imagini sau alte obiecte.
- Reranking — Reranking este reordonarea unui set de rezultate recuperate folosind un model sau o regulă mai precisă decât căutarea inițială.
- Prompt Injection — Prompt injection este o intrare care încearcă să schimbe instrucțiunile sau comportamentul unui sistem bazat pe modele de limbaj.
Surse și documentație
- Patrick Lewis și coautori — Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks22 mai 2020 · Accesat la 3 august 2026 · Lucrarea de cercetare care a introdus formularea RAG folosită ca definiție de referință.
- OpenAI — Vector stores — API Referencedocumentație curentă · Accesat la 3 august 2026 · Exemplu de implementare furnizor-specific; arhitectura articolului rămâne independentă de furnizor.
- Microsoft — Document-level access control in Azure AI Searchactualizat în iulie 2026 · Accesat la 3 august 2026 · Unele mecanisme descrise sunt preview; verificați statutul înainte de alegerea arhitecturii.
- NIST — AI RMF: Generative Artificial Intelligence Profile (NIST AI 600-1)26 iulie 2024; pagină actualizată 8 aprilie 2026 · Accesat la 3 august 2026 · Cadru voluntar; tratează riscuri și măsuri pentru AI generativ.
- ENISA — Artificial Intelligence Cybersecurity Challenges15 decembrie 2020 · Accesat la 3 august 2026
- Parlamentul European și Consiliul UE — Regulamentul (UE) 2016/679 — GDPR27 aprilie 2016 · Accesat la 3 august 2026
- European Data Protection Board — Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models17 decembrie 2024 · Accesat la 3 august 2026 · Evaluările privind anonimitatea și interesul legitim sunt dependente de context.
Ai nevoie de ajutor cu implementarea?
NextChapter ajută companiile românești să aplice exact ce ai citit în acest ghid.
Discută cu echipa NextChapter →