Fundamentele RAG
Concepte de bază pentru Retrieval-Augmented Generation: ce e, cum funcționează, când alegi RAG în loc de fine-tuning sau un LLM clasic

Ce este un LLM și de ce are nevoie de context extern
Cum funcționează un LLM, unde stă de fapt ce știe, de ce inventează un răspuns când nu are datele tale și ce înseamnă, mecanic, context extern.

Fereastra de context la LLM: cum decizi ce intră în prompt
Ce este fereastra de context, de ce un model cu un milion de tokeni nu rezolvă totul și cum construiești un buget de prompt cu plafoane clare.

Ce este semantic search și cum diferă de full-text
Semantic search caută sensul, nu cuvintele exacte. Vezi cum diferă de full-text și BM25, unde eșuează fiecare și când ai nevoie de amândouă.

Cum funcționează embeddings și de ce contează pentru RAG
Embeddings transformă textul în vectori care păstrează sensul, nu cuvintele. Vezi cum se generează, ce e cosine similarity și cum alegi modelul potrivit.

RAG vs fine-tuning: când alegi care abordare
Compari RAG cu fine-tuning pe 8 criterii. Vezi 3 scenarii cu cost real și decision tree în 4 întrebări pentru a alege arhitectura corectă.

Ce este RAG (Retrieval-Augmented Generation) și când îl folosești
RAG conectează un model AI la documentele tale înainte să răspundă. Înțelegi cum funcționează, când îl folosești și ce stack tehnic ai nevoie pentru un MVP funcțional în 2-4 săptămâni.