From 35caeae3b8d3e6e9e01b7b68282380ba70dbc350 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?=D0=94=D0=B0=D0=BD=D0=B8=D0=B8=D0=BB=20=D0=92=D0=B8=D0=BA?= =?UTF-8?q?=D1=82=D0=BE=D1=80=D0=BE=D0=B2?= Date: Thu, 2 Jul 2026 09:38:01 +0000 Subject: [PATCH] =?UTF-8?q?fix:=20vectorstore.py=20=E2=80=94=20=D0=AD?= =?UTF-8?q?=D0=BA=D0=B7=D0=B0=D0=BC=D0=B5=D0=BD:=20RAG-=D0=B0=D0=B3=D0=B5?= =?UTF-8?q?=D0=BD=D1=82=20=D1=81=20ChromaDB=20=D0=B8=20=D0=B2=D0=B5=D0=B1-?= =?UTF-8?q?=D0=BF=D0=BE=D0=B8=D1=81=D0=BA=D0=BE=D0=BC?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- vectorstore.py | 34 ++++++++++++++++++++++++++++++++++ 1 file changed, 34 insertions(+) create mode 100644 vectorstore.py diff --git a/vectorstore.py b/vectorstore.py new file mode 100644 index 0000000..2deb990 --- /dev/null +++ b/vectorstore.py @@ -0,0 +1,34 @@ +import os +from langchain_community.embeddings import OllamaEmbeddings +from langchain_chroma import Chroma +from langchain_text_splitters import RecursiveCharacterTextSplitter +from langchain_core.documents import Document + +def create_vectorstore(persist_directory: str = "./chroma_db") -> Chroma: + embeddings = OllamaEmbeddings(model="nomic-embed-text") + return Chroma( + collection_name="knowledge", + embedding_function=embeddings, + persist_directory=persist_directory, + ) + +def load_documents(directory: str, vectorstore: Chroma) -> None: + splitter = RecursiveCharacterTextSplitter(chunk_size=1000, chunk_overlap=200) + documents = [] + for root, _, files in os.walk(directory): + for file in files: + if file.endswith((".txt", ".md")): + path = os.path.join(root, file) + with open(path, "r", encoding="utf-8") as f: + content = f.read() + docs = splitter.split_text(content) + for i, chunk in enumerate(docs): + documents.append( + Document( + page_content=chunk, + metadata={"source": path, "chunk": i}, + ) + ) + if documents: + vectorstore.add_documents(documents) + vectorstore.persist() \ No newline at end of file