From fdfcfa4b82ad0c094b2ecdc1ceff6920d84098b3 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?=D0=9C=D0=B0=D1=80=D0=B0=D1=82=20=D0=A4=D0=B0=D0=B7=D1=8B?= =?UTF-8?q?=D0=BB=D0=BE=D0=B2?= Date: Thu, 14 May 2026 16:54:05 +0000 Subject: [PATCH] add chunker --- chunker.py | 7 +++++++ 1 file changed, 7 insertions(+) create mode 100644 chunker.py diff --git a/chunker.py b/chunker.py new file mode 100644 index 0000000..f9876e6 --- /dev/null +++ b/chunker.py @@ -0,0 +1,7 @@ +from langchain_text_splitter import RecursiveCharacterTextSplitter +from langchain.schema import Document + +def get_chunks(content: str, title: str): + splitter = RecursiveCharacterTextSplitter(chunk_size=1000, chunk_overlap=200) + texts = splitter.split_text(content) + return [Document(page_content=t, metadata={"title": title, "content": t}) for t in texts]