Экзамен: RAG-агент с ChromaDB и веб-поиском: vectorstore.py
This commit is contained in:
+63
-27
@@ -1,56 +1,92 @@
|
|||||||
import os
|
import os
|
||||||
from pathlib import Path
|
from pathlib import Path
|
||||||
from typing import List
|
from typing import Iterable
|
||||||
|
|
||||||
from langchain_ollama import OllamaEmbeddings
|
from langchain_ollama import OllamaEmbeddings
|
||||||
from langchain_chroma import Chroma
|
|
||||||
from langchain_text_splitters import RecursiveCharacterTextSplitter
|
from langchain_text_splitters import RecursiveCharacterTextSplitter
|
||||||
from langchain.docstore.document import Document
|
from langchain_chroma import Chroma
|
||||||
|
|
||||||
|
|
||||||
def create_vectorstore(persist_directory: str = "./chroma_db") -> Chroma:
|
def create_vectorstore(persist_directory: str = "./chroma_db") -> Chroma:
|
||||||
"""
|
"""
|
||||||
Создаёт и возвращает объект Chroma, подключённый к указанной директории.
|
Создаёт или загружает коллекцию ChromaDB с эмбеддингами Ollama.
|
||||||
Если директория не существует, она будет создана.
|
|
||||||
|
Args:
|
||||||
|
persist_directory (str): Путь к каталогу, где хранится база данных.
|
||||||
|
Если каталог не существует – будет создан новый.
|
||||||
|
|
||||||
|
Returns:
|
||||||
|
Chroma: объект vectorstore, готовый к добавлению документов и поиску.
|
||||||
"""
|
"""
|
||||||
|
# Убедимся, что директория для хранения существует
|
||||||
Path(persist_directory).mkdir(parents=True, exist_ok=True)
|
Path(persist_directory).mkdir(parents=True, exist_ok=True)
|
||||||
|
|
||||||
|
# Создаём эмбеддер Ollama (модель nomic-embed-text)
|
||||||
embeddings = OllamaEmbeddings(model="nomic-embed-text")
|
embeddings = OllamaEmbeddings(model="nomic-embed-text")
|
||||||
return Chroma(
|
|
||||||
|
# Инициализируем Chroma с указанным каталогом хранения
|
||||||
|
vectorstore = Chroma(
|
||||||
persist_directory=persist_directory,
|
persist_directory=persist_directory,
|
||||||
embedding_function=embeddings,
|
embedding_function=embeddings,
|
||||||
)
|
)
|
||||||
|
return vectorstore
|
||||||
|
|
||||||
|
|
||||||
def _load_text_files(directory: str) -> List[Document]:
|
def _load_text_files(directory: str) -> Iterable[str]:
|
||||||
"""
|
"""
|
||||||
Читает все .txt и .md файлы из указанной директории и возвращает список Document.
|
Генератор, возвращающий содержимое всех .txt и .md файлов из указанной папки.
|
||||||
|
Папка может быть вложенной – рекурсивно ищем файлы.
|
||||||
|
|
||||||
|
Args:
|
||||||
|
directory (str): Корневая директория для поиска файлов.
|
||||||
|
|
||||||
|
Yields:
|
||||||
|
str: Текстовый контент файла.
|
||||||
"""
|
"""
|
||||||
docs: List[Document] = []
|
for root, _, files in os.walk(directory):
|
||||||
for file_path in Path(directory).rglob("*"):
|
for file_name in files:
|
||||||
if file_path.suffix.lower() in {".txt", ".md"}:
|
if file_name.lower().endswith((".txt", ".md")):
|
||||||
text = file_path.read_text(encoding="utf-8")
|
path = Path(root) / file_name
|
||||||
docs.append(Document(page_content=text, metadata={"source": str(file_path)}))
|
try:
|
||||||
return docs
|
with open(path, "r", encoding="utf-8") as f:
|
||||||
|
yield f.read()
|
||||||
|
except Exception as exc: # pragma: no cover
|
||||||
|
print(f"Не удалось прочитать {path}: {exc}")
|
||||||
|
|
||||||
|
|
||||||
def load_documents(directory: str, vectorstore: Chroma) -> None:
|
def load_documents(directory: str, vectorstore: Chroma) -> None:
|
||||||
"""
|
"""
|
||||||
Загружает документы из указанной директории в ChromaDB.
|
Загружает документы из указанной папки в коллекцию ChromaDB.
|
||||||
Делает чанкинг с помощью RecursiveCharacterTextSplitter и добавляет в коллекцию.
|
Каждый документ разбивается на чанки с помощью RecursiveCharacterTextSplitter
|
||||||
|
и добавляется в vectorstore.
|
||||||
|
|
||||||
|
Args:
|
||||||
|
directory (str): Путь к каталогу, содержащему .txt/.md файлы.
|
||||||
|
vectorstore (Chroma): Экземпляр vectorstore, куда будут добавлены документы.
|
||||||
"""
|
"""
|
||||||
# Читаем файлы
|
# Читаем все текстовые файлы из директории
|
||||||
raw_docs = _load_text_files(directory)
|
texts = list(_load_text_files(directory))
|
||||||
|
if not texts:
|
||||||
|
print(f"В каталоге {directory} не найдено .txt или .md файлов.")
|
||||||
|
return
|
||||||
|
|
||||||
# Разбиваем на чанки
|
# Разбиваем каждый документ на чанки
|
||||||
splitter = RecursiveCharacterTextSplitter(
|
splitter = RecursiveCharacterTextSplitter(
|
||||||
chunk_size=1000,
|
chunk_size=1000, # размер чанка в символах (можно настроить)
|
||||||
chunk_overlap=200,
|
chunk_overlap=200, # перекрытие для сохранения контекста
|
||||||
separators=["\n\n", "\n", " ", ""],
|
|
||||||
)
|
)
|
||||||
chunks = splitter.split_documents(raw_docs)
|
all_chunks = []
|
||||||
|
for text in texts:
|
||||||
|
chunks = splitter.split_text(text)
|
||||||
|
all_chunks.extend(chunks)
|
||||||
|
|
||||||
# Добавляем в коллекцию
|
if not all_chunks:
|
||||||
vectorstore.add_documents(chunks)
|
print("После чанкинга не осталось текста.")
|
||||||
# Сохраняем изменения
|
return
|
||||||
|
|
||||||
|
# Добавляем чанки в vectorstore
|
||||||
|
vectorstore.add_texts(all_chunks)
|
||||||
|
|
||||||
|
# Сохраняем изменения (persist)
|
||||||
vectorstore.persist()
|
vectorstore.persist()
|
||||||
print(f"Загружено {len(chunks)} чанков из {len(raw_docs)} документов в {vectorstore.persist_directory}")
|
print(f"Загружено {len(all_chunks)} чанков из {directory} в ChromaDB.")
|
||||||
Reference in New Issue
Block a user