AI

RAG pentru Companii: Cum Construiești un Asistent AI pe Documentele Interne

RAG combină recuperarea unor fragmente din surse controlate cu generarea unui răspuns de către un model. Merită când informația se află în documente care se schimbă, răspunsul trebuie să citeze sursa și accesul poate fi controlat; nu elimină erorile și nu înlocuiește guvernanța documentelor.

22 minute de lectură · Publicat: 3 august 2026 · Actualizat: 3 august 2026

Scris de Vlad Covaci

Pe scurt

RAG combină recuperarea unor fragmente din surse controlate cu generarea unui răspuns de către un model. Merită când informația se află în documente care se schimbă, răspunsul trebuie să citeze sursa și accesul poate fi controlat; nu elimină erorile și nu înlocuiește guvernanța documentelor.

Ce este RAG

Retrieval-Augmented Generation (RAG) este o arhitectură în care sistemul caută informație relevantă într-o colecție externă și o oferă modelului ca context pentru răspuns. Lucrarea lui Lewis și coautorii a formulat RAG ca o combinație între memoria parametrică a modelului și o memorie non-parametrică recuperată. Implementările enterprise de astăzi adaugă parsare, permisiuni, citări, reranking, evaluare și monitorizare.

RAG nu «învață» automat documentele în parametrii modelului. La fiecare întrebare, aplicația caută fragmente și construiește contextul. Acest lucru face actualizarea mai ușoară decât reantrenarea, dar introduce erori noi: documentul poate fi ratat, fragmentul poate fi nepotrivit sau modelul poate răspunde dincolo de sursă.

RAG versus chatbot, search și fine-tuning

Alege mecanismul după problemă, nu după popularitate
AbordarePunct forteLimităCând o alegi
Chatbot generalConversație și cunoștințe generaleNu cunoaște sursele interne actualeSarcini fără informații proprietare
Search clasicRezultate exacte și navigareUtilizatorul sintetizeazăDocumente bine indexate și nevoie de control
RAGRăspuns cu surse actualizabileRetrieval și generare pot greșiÎntrebări pe documente multiple
Fine-tuningStil sau comportament repetabilNu este baza ideală pentru fapte mereu actualeFormat, clasificare sau policy de răspuns

Search și RAG pot coexista: utilizatorul vede răspunsul, fragmentele și lista de rezultate. Fine-tuning-ul poate standardiza comportamentul, dar nu înlocuiește sursa verificabilă. Pentru întrebări cu răspuns exact într-o bază de date, o interogare structurată poate fi mai sigură decât RAG.

Use cases potrivite

Când RAG nu este potrivit

Nu folosi RAG ca sistem de evidență pentru solduri, inventar sau statusuri care trebuie citite exact dintr-o bază de date. Evită-l când documentele nu au owner, permisiunile nu pot fi păstrate sau răspunsul trebuie să reprezinte o decizie profesională finală. Dacă utilizatorul are nevoie doar de documentul potrivit, search poate fi mai simplu și mai transparent.

Arhitectura RAG, de la sursă la răspuns

Flux RAG cu citări și control de acces

Alternativă textuală: documentele autorizate sunt prelucrate, indexate și recuperate pentru identitatea utilizatorului; modelul răspunde din fragmentele permise, apoi sistemul verifică și monitorizează rezultatul.

  1. Conectează sursele aprobate și preia documentul, versiunea, ownerul și permisiunile.
  2. Parsează conținutul, elimină zgomotul și păstrează structura utilă.
  3. Împarte în fragmente, adaugă metadata și generează reprezentări pentru căutare.
  4. La întrebare, autentifică utilizatorul și aplică filtrele de permisiuni.
  5. Recuperează, rerankează și construiește un context limitat și citabil.
  6. Generează răspunsul, validează citările, aplică refuzul și înregistrează evaluarea.

Pregătirea surselor

Inventariază depozitele, formatele, proprietarii și ciclul de viață. Decide ce documente sunt autoritative și ce conținut nu trebuie indexat. Un folder partajat nu este o taxonomie. Duplicatele și versiunile vechi trebuie marcate sau excluse înainte ca sistemul să le transforme în răspunsuri fluente.

Parsing, chunking și metadata

Parserul trebuie să păstreze titluri, tabele, liste, pagini și relația cu fișierul. Chunking-ul nu are o dimensiune universală: un fragment prea mic pierde contextul, unul prea mare diluează semnalul și costă. Testează pe întrebările reale. Metadata minimă include sursa, versiunea, secțiunea, data, ownerul, limbajul și permisiunile.

Specificație de ingestie
CâmpCerință
document_idStabil și unic între versiuni
source_urlAdresă accesibilă utilizatorului autorizat
version / effective_dateVersiune și dată de intrare în vigoare
ownerPersoană sau funcție responsabilă
heading_pathIerarhia secțiunii
permissionsUtilizatori, grupuri sau reguli moștenite
checksumDetectarea schimbărilor
deleted_atPropagarea eliminării

Embeddings, retrieval și reranking

Embeddings reprezintă semantic fragmentele și întrebarea pentru a aproxima similitudinea. Căutarea hibridă combină frecvent semnal semantic cu termeni exacți, utili pentru coduri, clauze sau nume. Reranking-ul reordonează un set de candidați cu un model suplimentar. Fiecare etapă trebuie evaluată separat.

Documentația OpenAI Vector Stores arată un exemplu furnizor-specific de chunking și semantic search. Nu copia valorile implicite ca standard. Furnizorul, limba română, structura documentelor și întrebările pot cere altă strategie.

Construirea contextului și generarea

Contextul trebuie să conțină suficiente fragmente pentru răspuns, dar nu documente întregi fără nevoie. Include delimitatori, identitatea sursei și instrucțiunea de a refuza când informația lipsește. Tratează textul recuperat ca date neîncrezătoare: un document poate conține instrucțiuni malițioase de tip prompt injection.

Citări verificabile

O citare bună deschide documentul și secțiunea pe care utilizatorul are dreptul să o vadă. Verifică programatic dacă afirmația este susținută de fragment, nu doar dacă modelul a tipărit un ID. Pentru răspunsuri care combină surse, asociază fiecare afirmație importantă cu sursa corespunzătoare.

Acces la nivel de document

Autentificarea aplicației nu este suficientă; retrieval-ul trebuie să filtreze după utilizator și grupuri înainte de a trimite fragmente modelului. Azure AI Search documentează mecanisme de security filters și funcții ACL/RBAC, unele încă preview în 2026. Indiferent de produs, testează sincronizarea permisiunilor și comportamentul fail-closed.

Checklist de acces
ControlTest
AutentificareUtilizator absent sau token expirat este respins
FiltrareUn grup nu vede documentele altui grup
MoștenireSchimbarea permisiunii ajunge în index
ȘtergereDocumentul dispare din retrieval și cache
CitareLinkul nu expune titlul ori conținutul neautorizat
Fail-closedEroarea sistemului de permisiuni nu returnează rezultate

Freshness și documente șterse

Definește cât poate întârzia o actualizare și măsoară acest SLA. Păstrează versiunea activă, invalidează cache-ul și propagă ștergerea către fragmente, index, copii și evaluări unde este aplicabil. Un răspuns cu sursă veche trebuie fie marcat, fie refuzat.

Evaluarea retrieval-ului și răspunsului

NivelMetricăÎntrebare
RetrievalRecall@kFragmentul necesar apare între rezultate?
RankingMRR / evaluare umanăSursa bună apare suficient de sus?
RăspunsCorectitudineAfirmațiile răspund întrebării?
GroundednessSusținere în contextFiecare fapt este în surse?
CităriPrecizie și acoperireLinkul susține afirmația?
RefuzPrecizie refuzRefuză când sursa lipsește?
SecuritateAcces și injectionEvită conținutul neautorizat/malițios?
Șablon pentru datasetul de evaluare
CâmpConținut
questionÎntrebare reală, inclusiv variante românești
user_contextRoluri și permisiuni simulate
expected_sourcesDocumente și pasaje relevante
required_factsAfirmațiile necesare
forbidden_claimsConcluzii care nu sunt în surse
expected_actionRăspuns, clarificare sau refuz
riskImpactul unei erori

Monitorizare, cost și arhitectura pilotului

Monitorizează întrebări fără rezultat, surse vechi, citări invalide, acces respins, cost, latență și feedback. Nu păstra automat conținut sensibil în loguri. Costul include ingestia, embeddings, indexul, retrieval-ul, reranking-ul, modelul, evaluările și operarea, nu doar tokenii răspunsului.

  1. Alege o colecție cu owner, versiuni și permisiuni clare.
  2. Construiește 50–100 de întrebări reprezentative înainte de optimizare.
  3. Livrează search + răspuns + citări într-un grup restrâns.
  4. Testează accesul, ștergerea, injection, refuzul și fallback-ul.
  5. Măsoară retrieval-ul separat de generare și rezolvă veriga slabă.
  6. Extinde numai după checklistul de producție.

Exemplu ipotetic: asistent pentru proceduri

Exemplu ipotetic: o companie are 400 de proceduri în română și engleză, distribuite în două depozite. Pilotul include numai procedurile active ale unui departament. Fiecare document primește owner, versiune, dată efectivă și grupuri. Utilizatorul vede răspunsul, pasajele și linkul către sursă.

Setul de evaluare conține întrebări directe, combinații între proceduri, întrebări fără răspuns și utilizatori fără acces. Un răspuns fluent din documentul greșit este eșec. Un refuz corect pentru documentul neautorizat este succes, chiar dacă informația există în index pentru alt grup.

Teste de securitate specifice RAG

TestRezultat așteptat
Instrucțiune malițioasă în documentEste tratată ca date, nu executată
Întrebare despre document neautorizatRefuz fără divulgarea existenței/conținutului
Permisiune revocatăDocumentul dispare în intervalul acceptat
Citare inventatăValidatorul respinge linkul sau pasajul inexistent
Query foarte lung / repetatLimite de resurse și rate limiting
Document coruptIngestia eșuează controlat și alertează ownerul

Alegerea stivei tehnice

Compară serviciile pe conectori, parsare, căutare hibridă, filtre, ACL, regiune, ștergere, observabilitate și portabilitate. O bază vectorială nu este întreaga soluție. Uneori motorul de search existent și o componentă de generare sunt suficiente; alteori produsul de knowledge management oferă deja permisiunile și auditul.

Păstrează o interfață de evaluare independentă de furnizor: aceeași întrebare, aceleași surse așteptate și aceeași rubrică. Astfel poți compara un model, retriever sau reranker nou fără a confunda schimbarea tehnică cu schimbarea datasetului.

Operarea conținutului

Latență și cost pe răspuns valid

Măsoară separat timpul de autentificare, retrieval, reranking, generare și verificare. Un răspuns mai lung poate costa mai mult fără să fie mai util. Limitează top-k, contextul și răspunsul pe baza evaluărilor, nu doar pentru a reduce factura.

Costul corect este costul per răspuns valid: include ingestia amortizată, indexul, modelele, retry-urile, evaluarea, monitorizarea și review-ul. Dacă o cerere eșuează și este reluată de trei ori, toate apelurile aparțin aceluiași rezultat. Compară și cu search fără generare.

Întrebări multilingve și româna

Testează documente și întrebări în limbi diferite, diacritice, abrevieri și terminologie internă. Decide dacă retrieval-ul caută cross-lingual sau traduce întrebarea și cum păstrează citarea originală. O traducere fluentă nu trebuie să modifice termenii contractuali ori procedurali.

Limitări

RAG nu garantează adevărul, completitudinea sau confidențialitatea. Acestea depind de documente, arhitectură, permisiuni și operare. Nu îl folosi ca substitut pentru consultanță profesională, baze de date tranzacționale sau aprobări. Pentru selecția între produs și dezvoltare, folosește ghidul build versus buy, iar pentru suport vezi chatbot, copilot sau agent.

Resurse pentru pasul următor

Aplică acest cadru într-o situație reală

Vlad CovaciScris deVlad CovaciFondator & Partener Produs și Tehnologie

Întrebări frecvente

RAG înseamnă că modelul este antrenat pe documentele firmei?
De regulă, nu. Documentele sunt indexate și fragmentele relevante sunt trimise ca context la fiecare întrebare. Fine-tuning-ul este un mecanism diferit.
RAG elimină halucinațiile?
Nu. Poate îmbunătăți ancorarea și citarea, dar retrieval-ul, ranking-ul și generarea pot greși. Sunt necesare evaluare și refuz.
Pot indexa toate documentele din companie?
Nu este recomandat. Include numai surse cu scop, owner, versiune și permisiuni clare. Respectă accesul și ștergerea.
Când aleg search fără generare?
Când utilizatorul are nevoie de documentul exact, riscul unei sinteze este mare sau răspunsul trebuie verificat integral la sursă.
Cum testez RAG în română?
Folosește întrebări reale cu diacritice, fără diacritice, sinonime, termeni interni, întrebări fără răspuns și utilizatori cu permisiuni diferite.

Termeni cheie din acest ghid

  • RAG — Retrieval-Augmented Generation RAG (Retrieval-Augmented Generation) este o tehnică AI care combină un motor de căutare în documente proprii cu un LLM, permițând modelului să răspundă pe baza informațiilor specifice ale companiei tale.
  • Embeddings Embeddings sunt reprezentări numerice folosite pentru a aproxima relațiile semantice dintre texte, imagini sau alte obiecte.
  • Reranking Reranking este reordonarea unui set de rezultate recuperate folosind un model sau o regulă mai precisă decât căutarea inițială.
  • Prompt Injection Prompt injection este o intrare care încearcă să schimbe instrucțiunile sau comportamentul unui sistem bazat pe modele de limbaj.

Surse și documentație

Ai nevoie de ajutor cu implementarea?

NextChapter ajută companiile românești să aplice exact ce ai citit în acest ghid.

Discută cu echipa NextChapter →

Esti pregatit pentru urmatorul capitol?

Programeaza o discutie si vedem cum putem ajuta afacerea ta sa creasca mai rapid cu ajutorul AI. Fara sales, fara presiune, doar o conversatie utila.

Raspundem in maxim 24h · Consultatie gratuita · Fara obligatii