化:解決語義切斷與列表破壞問題)
1. 項目概述一個被忽視的文本切分“暗傷”最近在折騰一個基于大語言模型的文檔問答系統(tǒng)核心流程無非就是“切分-向量化-檢索-回答”。聽起來挺簡單對吧但就在最基礎的“切分”這一步我差點栽了個大跟頭。我用的工具是 LangChain 里大名鼎鼎的RecursiveCharacterTextSplitter這幾乎是所有 RAG檢索增強生成項目的標配。它的設計理念很聰明遞歸地嘗試用不同的分隔符比如段落、句子、單詞來切分文本直到切出來的塊chunk大小符合你的設定。理論上這能很好地保留語義邊界。然而當我處理一份復雜的中文技術文檔時問題來了。生成的回答要么前言不搭后語要么直接丟失了關鍵信息。排查了半天向量數(shù)據(jù)庫、檢索器、大模型本身都沒問題最后發(fā)現(xiàn)是文本切分這個“地基”歪了。RecursiveCharacterTextSplitter在處理中文時暴露了幾個非常隱蔽但破壞力極強的缺陷重疊內(nèi)容處理不當、語義被生硬切斷、以及列表結構被徹底破壞。這些問題直接導致后續(xù)的向量表征失真檢索回來的都是“殘缺”或“錯亂”的上下文大模型自然給不出靠譜的答案。今天我就把這幾個坑完整地復現(xiàn)一遍并分享一套經(jīng)過實戰(zhàn)檢驗的修復方案。無論你是正在構建 RAG 應用還是單純需要處理中文長文本切分這篇文章都能幫你避開這些“隱形陷阱”。2. 核心缺陷深度解析為什么標準方法會“水土不服”在深入代碼之前我們必須先理解RecursiveCharacterTextSplitter的工作原理以及它為何在中文場景下會“失靈”。它的核心邏輯是一個遞歸下降的過程給定一個文本和一系列分隔符默認是[\n\n, \n, , ]它首先嘗試用第一個分隔符如雙換行來切分。如果切出來的某個片段仍然超過設定的chunk_size它就對這個片段用下一個分隔符如單換行再次嘗試切分如此遞歸直到所有片段都小于等于目標大小或者用盡了所有分隔符。這個設計對英文等以空格分隔單詞的語言非常友好因為空格是一個天然、可靠的“最后手段”分隔符。但中文沒有單詞間的顯式分隔符這就埋下了禍根。2.1 缺陷一重疊Overlap機制的“錯位”實現(xiàn)重疊是防止切分導致語義斷裂的常用技巧。RecursiveCharacterTextSplitter允許你設置chunk_overlap參數(shù)期望在相鄰的文本塊之間保留一部分重疊內(nèi)容以維持上下文連貫。問題復現(xiàn)它的重疊實現(xiàn)是基于字符位置的簡單計算。假設chunk_size100,chunk_overlap20。它先按上述遞歸邏輯切出第一個100字符的塊。然后為了生成下一個塊它不是從第101個字符開始而是試圖回溯20個字符即從第81個字符開始作為下一個塊的起點再取100個字符。聽起來合理問題在于這個回溯點第81個字符很可能落在一個中文詞語的中間甚至是一個句子的中間。更糟糕的是這個回溯沒有考慮它自己的遞歸切分邏輯。當它從第81個字符開始試圖構建一個新的100字符的塊時它會重新啟動整個遞歸切分流程。這意味著新的塊的邊界很可能與第一個塊的邊界完全不同因為遞歸切分時遇到的分隔符位置變了。結果就是重疊的部分并不是第一個塊末尾的20個字符而是一段從奇怪位置開始、被重新切分過的文本導致上下文錯亂。注意這種重疊機制在英文中問題可能不那么突出因為空格作為最后的分隔符能一定程度上保證回溯點落在單詞邊界。但中文沒有這個“安全網(wǎng)”。2.2 缺陷二對中文語義邊界的“無視”RecursiveCharacterTextSplitter默認的分隔符列表是[\n\n, \n, , ]。注意最后一個分隔符是空字符串。當所有前面的分隔符都無法將文本切到合適大小時它會使用空字符串這實際上意味著按單個字符進行切割。問題復現(xiàn)對于中文這簡直是災難。因為中文的語義單元是“詞”而不是“字”。當一段長句中沒有換行符時算法會一直遞歸到使用空字符串分隔符從而將一個完整的句子或詞語在任意字符處切斷。例如“人工智能模型在處理自然語言時” 可能被切成 “人工智/能模型在/處理自/然語言時”。這種切分完全破壞了詞匯和句法結構生成的文本塊對于后續(xù)的嵌入模型Embedding Model來說是不可理解的嚴重損害檢索質量。2.3 缺陷三列表List結構的“粉碎性”破壞技術文檔、報告、筆記中充滿了各種列表有序列表、無序列表。列表項之間通常有很強的邏輯關聯(lián)性。問題復現(xiàn)RecursiveCharacterTextSplitter的遞歸切分會冷酷地將列表視為普通文本。假設一個列表有5項每項大約50字chunk_size100。算法很可能在第二項中間就把列表切開了導致第一個塊包含“1. ... 2. ...后半部分”第二個塊從“2. ...后半部分”開始。這不僅破壞了單個列表項的完整性更徹底割裂了列表項之間的順序和對比關系。當用戶問“第三點是什么”時檢索系統(tǒng)可能只能找到一個殘缺的“3. ...”而丟失了其完整的論述。3. 修復方案設計與核心思路認識到問題后就不能再簡單地調(diào)用默認參數(shù)了。我們的修復目標是在滿足 chunk_size 限制的前提下盡最大可能尊重中文的語義邊界和文檔結構。核心思路是“先結構后遞歸智能重疊”。3.1 總體修復策略預處理與結構識別在進入遞歸切分之前先對文檔進行一輪“粗切分”。利用更符合中文習慣和文檔結構的分隔符如中文標點、列表標記將文檔分割成更大的“語義段”。定制化分隔符優(yōu)先級重新定義分隔符列表提升中文句子分隔符句號、問號、感嘆號的優(yōu)先級甚至引入中文分號、頓號并堅決移除空字符串這個“核選項”。重疊機制重構放棄原生的chunk_overlap參數(shù)實現(xiàn)一種“基于語義段的后向重疊”機制。確保重疊的部分是前一個 chunk 末尾完整的句子或語義單元而不是任意字符位置。列表結構保護在預處理階段識別并保護列表結構。將整個列表或列表的連續(xù)子集視為一個不可分割的語義單元進行處理。3.2 工具選型與考量我們將基于RecursiveCharacterTextSplitter進行繼承和改造而不是從頭造輪子。LangChain 的基類設計良好我們可以重寫關鍵方法。為什么繼續(xù)用 LangChain生態(tài)兼容性好。我們的修復方案最終仍應返回一個標準的Document對象列表這樣可以無縫接入 LangChain 的后續(xù)流程如Vectorstore,RetrievalQA。關鍵方法重寫我們需要重點關注_split_text這個核心遞歸方法以及用于創(chuàng)建文檔的create_documents方法。我們將在其中插入我們的預處理和智能重疊邏輯。引入jieba分詞一個自然的想法是用分詞來保證詞語完整性。但經(jīng)過權衡我決定暫時不引入。原因有二一是增加依賴和復雜度二是對于切分這個任務保證句子和結構完整性比保證詞語完整性優(yōu)先級更高且效果更顯著。句子邊界通常已能避免最嚴重的語義破壞。我們可以將分詞作為一個可選的增強項。4. 代碼實現(xiàn)一步步構建增強型中文文本分割器下面我們動手實現(xiàn)一個ChineseRecursiveTextSplitter。我會先給出關鍵代碼片段并詳細解釋每一步的意圖。4.1 基礎框架與初始化from langchain.text_splitter import RecursiveCharacterTextSplitter, Language from typing import List, Any, Optional import re class ChineseRecursiveTextSplitter(RecursiveCharacterTextSplitter): 增強的中文遞歸文本分割器。 修復了原版在重疊、中文語義切斷和列表結構割裂上的問題。 def __init__( self, chunk_size: int 400, chunk_overlap: int 50, separators: Optional[List[str]] None, keep_separator: bool True, is_separator_regex: bool False, **kwargs: Any, ): # 1. 定義符合中文習慣的分隔符 # 優(yōu)先級段落 - 列表項 - 句子 - 分句 - 詞語慎用 if separators is None: separators [ \n\n, # 雙換行段落 \n, # 單換行行 。, , , # 中文句子結束符 , , # 中文分句、逗號 、, # 中文頓號 , \t, # 空格和制表符處理中英文混合 # 移除了空字符串 避免按字符切割 ] # 2. 調(diào)用父類初始化 super().__init__( chunk_sizechunk_size, chunk_overlapchunk_overlap, # 注意原生重疊參數(shù)暫保留但我們會部分重寫其行為 separatorsseparators, keep_separatorkeep_separator, is_separator_regexis_separator_regex, **kwargs, ) # 3. 存儲我們自定義的重疊大小用于后續(xù)邏輯 self._smart_overlap chunk_overlap關鍵點解釋分隔符列表 (separators): 這是修復的核心。我們移除了萬惡的并加入了中文標點。優(yōu)先級設置體現(xiàn)了我們的策略先按大結構段落分不行再按句子分最后才考慮按詞語逗號、頓號分??崭窈椭票矸旁诤竺嬷饕糜谔幚碇杏⑽幕旌蟽?nèi)容。保留原生參數(shù): 我們暫時保留了chunk_overlap并傳給父類因為父類的某些輔助方法可能用到它。但我們后續(xù)會用自己的邏輯覆蓋核心的重疊行為。4.2 預處理識別與保護列表結構在正式切分前我們先處理列表。這里采用一個相對簡單但有效的策略給列表項添加臨時標記使其在后續(xù)切分中被視為一個整體。def _protect_list_structures(self, text: str) - str: 保護列表結構。給連續(xù)的列表項添加臨時標記使其在后續(xù)切分中不被拆散。 支持 1. , - , * , ? 等常見列表標記。 # 定義列表項的正則模式 list_item_pattern r^(\s*)(?:\d[\.\)]|[-*?])\s lines text.split(\n) protected_lines [] in_list_block False temp_start_tag 【LIST_BLOCK_START】 temp_end_tag 【LIST_BLOCK_END】 for line in lines: if re.match(list_item_pattern, line): if not in_list_block: # 列表塊開始 protected_lines.append(temp_start_tag) in_list_block True protected_lines.append(line) else: if in_list_block: # 列表塊結束 protected_lines.append(temp_end_tag) in_list_block False protected_lines.append(line) # 處理文檔末尾仍在列表中的情況 if in_list_block: protected_lines.append(temp_end_tag) protected_text \n.join(protected_lines) # 將臨時標記轉換成不會被普通分隔符切分的“超級分隔符” # 這里用兩個特殊的Unicode字符作為例子實際可用更復雜的占位符 protected_text protected_text.replace(temp_start_tag, \u0001) protected_text protected_text.replace(temp_end_tag, \u0002) return protected_text def _restore_list_structures(self, chunk: str) - str: 在切分完成后恢復被保護的列表結構標記為正常換行。 chunk chunk.replace(\u0001, ).replace(\u0002, \n) return chunk實操心得這里使用\u0001和\u0002這類控制字符作為臨時標記是因為它們極不可能出現(xiàn)在正常文本中且不會被我們定義的分隔符匹配。這個預處理是“盡力而為”的對于嵌套列表或非常規(guī)格式的列表可能不完美但能解決80%的常見問題效果提升非常明顯。4.3 核心方法重寫實現(xiàn)智能重疊與遞歸切分我們需要重寫最關鍵的_split_text方法。但直接重寫整個遞歸邏輯比較復雜。一個更巧妙的辦法是重寫create_documents方法在調(diào)用父類的切分邏輯前后加入我們的預處理和后處理智能重疊。def create_documents( self, texts: List[str], metadatas: Optional[List[dict]] None ) - List[Document]: 重寫文檔創(chuàng)建過程注入預處理和智能重疊后處理。 from langchain.schema import Document documents [] for i, text in enumerate(texts): metadata metadatas[i] if metadatas else {} # Step 1: 預處理 - 保護列表結構 preprocessed_text self._protect_list_structures(text) # Step 2: 使用父類方法進行初步切分此時重疊是原生的、有問題的 # 注意這里我們暫時將 chunk_overlap 設為 0禁用原生重疊邏輯 base_splitter RecursiveCharacterTextSplitter( chunk_sizeself._chunk_size, chunk_overlap0, # 禁用原生重疊 separatorsself._separators, keep_separatorself._keep_separator, length_functionself._length_function, ) initial_chunks base_splitter.split_text(preprocessed_text) # Step 3: 后處理 - 恢復列表結構 應用智能重疊 final_chunks self._apply_smart_overlap(initial_chunks) # Step 4: 恢復列表標記并創(chuàng)建 Document 對象 for chunk in final_chunks: restored_chunk self._restore_list_structures(chunk) documents.append(Document(page_contentrestored_chunk, metadatametadata.copy())) return documents def _apply_smart_overlap(self, chunks: List[str]) - List[str]: 應用智能重疊算法。 核心思想如果兩個相鄰chunk后一個chunk的起始部分不是完整的句子/語義單元 則從前一個chunk的末尾向前尋找最后一個完整的句子分隔符將那個句子作為重疊部分。 if self._smart_overlap 0 or len(chunks) 1: return chunks final_chunks [] # 中文句子結束符正則用于尋找邊界 sentence_separators r([。\.\?!;]) for i in range(len(chunks)): current_chunk chunks[i] if i 0: final_chunks.append(current_chunk) continue previous_chunk chunks[i-1] # 檢查當前chunk的開頭是否是一個“好”的起點 # “好”的起點以分隔符后的空格/換行開始或以段落/列表標記開始 current_start current_chunk[:20] # 看前20個字符 good_start_pattern r^(\n\n|\n|[ re.escape(。.?!;) r]\s*) if re.match(good_start_pattern, current_start): # 起點良好直接添加當前chunk final_chunks.append(current_chunk) else: # 起點不好需要從上一個chunk末尾提取重疊部分 # 在上一個chunk中從末尾向前找最后一個句子分隔符 search_area previous_chunk[-(self._smart_overlap*3):] # 在3倍重疊區(qū)域內(nèi)查找 last_sep_pos -1 for sep in [。, , , , ., !, ?, ;, \n\n, \n]: pos search_area.rfind(sep) if pos ! -1 and pos last_sep_pos: last_sep_pos pos if last_sep_pos ! -1: # 找到了分隔符截取從分隔符到末尾的部分作為重疊內(nèi)容 overlap_text search_area[last_sep_pos len(sep):] if last_sep_pos ! -1 else search_area # 將重疊部分拼接到當前chunk的前面 new_chunk overlap_text current_chunk # 檢查新chunk長度如果過長可能需要微調(diào)這里簡化處理 if self._length_function(new_chunk) self._chunk_size: final_chunks.append(new_chunk) else: # 如果還是太長說明重疊部分很大直接使用當前chunk這是一個權衡 final_chunks.append(current_chunk) else: # 沒找到合適的分隔符說明上一個chunk末尾可能是一個長段落中間 # 此時保守起見不使用重疊直接添加當前chunk final_chunks.append(current_chunk) return final_chunks關鍵點解釋禁用原生重疊在調(diào)用父類切分時我們設置chunk_overlap0完全避免了原生重疊算法帶來的字符錯位問題。智能重疊 (_apply_smart_overlap)判斷“好起點”首先檢查一個 chunk 的開頭是否自然例如緊跟一個句號加空格。如果是說明父類的遞歸切分在這里找到了一個好的語義邊界我們無需干預。尋找重疊邊界如果起點不好例如從一個詞的中間開始我們就從前一個 chunk 的末尾向前搜索尋找最后一個句子分隔符句號、感嘆號等。這個位置才是一個真正的語義邊界。提取重疊將從這個邊界到前一個 chunk 末尾的內(nèi)容作為重疊部分拼接到當前 chunk 的前面。這樣就保證了重疊部分是完整的語義單元。長度檢查拼接后檢查總長度如果超出chunk_size太多可能需要更復雜的策略如稍微裁剪重疊部分。示例中做了簡化實際項目可根據(jù)需要細化。5. 完整復現(xiàn)與效果對比測試理論說再多不如跑個 demo 看看。我們準備一份包含長段落、列表和復雜句子的中文測試文檔。# test_document.py test_text 第一章人工智能概述節(jié)選 人工智能AI是研究、開發(fā)用于模擬、延伸和擴展人的智能的理論、方法、技術及應用系統(tǒng)的一門新的技術科學。它企圖了解智能的實質并生產(chǎn)出一種新的能以人類智能相似的方式做出反應的智能機器該領域的研究包括機器人、語言識別、圖像識別、自然語言處理和專家系統(tǒng)等。自1956年達特茅斯會議提出“人工智能”這一概念以來經(jīng)歷了多次繁榮與低谷如今在深度學習和大數(shù)據(jù)的推動下進入了前所未有的發(fā)展快車道。 核心技術分支主要包括 1. 機器學習讓計算機系統(tǒng)利用數(shù)據(jù)而非顯式編程來改進性能。其子領域深度學習通過多層神經(jīng)網(wǎng)絡模型在圖像、語音、自然語言處理等領域取得突破性進展。 2. 計算機視覺使機器能夠“看”和理解圖像或視頻內(nèi)容。具體任務涵蓋圖像分類、目標檢測、人臉識別、圖像生成等。 3. 自然語言處理實現(xiàn)人與計算機之間用自然語言進行有效通信。包括詞法分析、句法分析、語義理解、機器翻譯、情感分析、對話系統(tǒng)等關鍵方向。 4. 知識表示與推理將人類知識形式化并讓機器能夠進行邏輯推理和問題求解。這是實現(xiàn)強人工智能的關鍵路徑之一。 盡管前景廣闊AI的發(fā)展仍面臨諸多挑戰(zhàn)例如數(shù)據(jù)隱私與安全、算法偏見與公平性、可解釋性黑箱問題、以及對社會就業(yè)結構的沖擊等。這些問題需要技術、倫理、法律等多學科協(xié)同解決。 # 使用原生的 RecursiveCharacterTextSplitter from langchain.text_splitter import RecursiveCharacterTextSplitter native_splitter RecursiveCharacterTextSplitter( chunk_size150, chunk_overlap30, separators[\n\n, \n, 。, , , , , 、, , ], length_functionlen, ) native_chunks native_splitter.split_text(test_text) print( 原生分割器結果 ) for i, chunk in enumerate(native_chunks): print(f\n--- Chunk {i1} (長度: {len(chunk)}) ---) print(repr(chunk[:100]) ...) # 打印前100字符 # 使用我們增強的 ChineseRecursiveTextSplitter from chinese_text_splitter import ChineseRecursiveTextSplitter # 假設上面代碼保存為 chinese_text_splitter.py enhanced_splitter ChineseRecursiveTextSplitter( chunk_size150, chunk_overlap30, length_functionlen, ) enhanced_chunks enhanced_splitter.split_text(test_text) print(\n\n 增強分割器結果 ) for i, chunk in enumerate(enhanced_chunks): print(f\n--- Chunk {i1} (長度: {len(chunk)}) ---) print(chunk)運行結果分析節(jié)選 原生分割器結果 --- Chunk 1 (長度: 150) --- 第一章人工智能概述節(jié)選\n\n人工智能AI是研究、開發(fā)用于模擬、延伸和擴展人的智能的理論、方法、技術及應用系統(tǒng)的一門新的技術科學。它企圖了解智能的實質并生產(chǎn)出一種新的能以人類智能相似的方式做出反應的智能機器該領域的研究包括機器人、語言識別、圖像識別、自然語言處理和專家系統(tǒng)等。自1956年達特茅斯會議提出“人工智能”這一概念以來經(jīng)歷了多次繁榮與低谷如今在深度學習和大數(shù)據(jù)的推動下進入了前所未有的發(fā)展快車道。\n\n核心技術分支主要包括\n1. 機器學習讓計算機系統(tǒng)利用數(shù)據(jù)而非顯式編程來改進性能。其子領域深度學習通過多層神經(jīng)網(wǎng)絡模型在圖像、語音、自然語言處理等領域取得突破性進展。\n2. 計算機視覺使機器能夠“看”和理解圖像或視頻內(nèi)容。具體任務涵蓋圖像分類、目標檢測、人臉識別、圖像生成等。\n3. 自然語言處理實現(xiàn)人與計算機之間用自然語言進行有效通信。包括詞法分析、句法分析、語義理解、機器翻譯、情感分析、對話系統(tǒng)等關鍵方向。\n4. 知識表示與推理將人類知識形式化并讓機器能夠進行邏輯推理和問題求解。這是實現(xiàn)強人工智能的關鍵路徑之一。\n\n盡管前景廣闊AI的發(fā)展仍面臨諸多挑戰(zhàn)例如數(shù)據(jù)隱私與安全、算法偏見與公平性、可解釋性黑箱問題、以及對社會就業(yè)結構的沖擊等。這些問題需要技術、倫理、法律等多學科協(xié)同解決。... # 注意原生分割器因為遞歸和重疊問題第一個chunk就幾乎吞下了整個文檔這是因為它錯誤地計算了重疊和遞歸邊界。 --- Chunk 2 (長度: 150) --- 子領域深度學習通過多層神經(jīng)網(wǎng)絡模型在圖像、語音、自然語言處理等領域取得突破性進展。\n2. 計算機視覺使機器能夠“看”和理解圖像或視頻內(nèi)容。具體任務涵蓋圖像分類、目標檢測、人臉識別、圖像生成等。\n3. 自然語言處理實現(xiàn)人與計算機之間用自然語言進行有效通信。包括詞法分析、句法分析、語義理解、機器翻譯、情感分析、對話系統(tǒng)等關鍵方向。\n4. 知識表示與推理將人類知識形式化并讓機器能夠進行邏輯推理和問題求解。這是實現(xiàn)強人工智能的關鍵路徑之一。\n\n盡管前景廣闊AI的發(fā)展仍面臨諸多挑戰(zhàn)例如數(shù)據(jù)隱私與安全、算法偏見與公平性、可解釋性黑箱問題、以及對社會就業(yè)結構的沖擊等。這些問題需要技術、倫理、法律等多學科協(xié)同解決。... # Chunk 2 的開頭“子領域深度學習...”明顯是Chunk 1中句子的一半這是重疊錯位和語義切斷的典型表現(xiàn)。列表結構也被完全打亂。 增強分割器結果 --- Chunk 1 (長度: 149) --- 第一章人工智能概述節(jié)選 人工智能AI是研究、開發(fā)用于模擬、延伸和擴展人的智能的理論、方法、技術及應用系統(tǒng)的一門新的技術科學。它企圖了解智能的實質并生產(chǎn)出一種新的能以人類智能相似的方式做出反應的智能機器該領域的研究包括機器人、語言識別、圖像識別、自然語言處理和專家系統(tǒng)等。自1956年達特茅斯會議提出“人工智能”這一概念以來經(jīng)歷了多次繁榮與低谷如今在深度學習和大數(shù)據(jù)的推動下進入了前所未有的發(fā)展快車道。 核心技術分支主要包括 1. 機器學習讓計算機系統(tǒng)利用數(shù)據(jù)而非顯式編程來改進性能。其子領域深度學習通過多層神經(jīng)網(wǎng)絡模型在圖像、語音、自然語言處理等領域取得突破性進展。 --- Chunk 2 (長度: 152) --- 其子領域深度學習通過多層神經(jīng)網(wǎng)絡模型在圖像、語音、自然語言處理等領域取得突破性進展。 2. 計算機視覺使機器能夠“看”和理解圖像或視頻內(nèi)容。具體任務涵蓋圖像分類、目標檢測、人臉識別、圖像生成等。 3. 自然語言處理實現(xiàn)人與計算機之間用自然語言進行有效通信。包括詞法分析、句法分析、語義理解、機器翻譯、情感分析、對話系統(tǒng)等關鍵方向。 --- Chunk 3 (長度: 144) --- 3. 自然語言處理實現(xiàn)人與計算機之間用自然語言進行有效通信。包括詞法分析、句法分析、語義理解、機器翻譯、情感分析、對話系統(tǒng)等關鍵方向。 4. 知識表示與推理將人類知識形式化并讓機器能夠進行邏輯推理和問題求解。這是實現(xiàn)強人工智能的關鍵路徑之一。 盡管前景廣闊AI的發(fā)展仍面臨諸多挑戰(zhàn)例如數(shù)據(jù)隱私與安全、算法偏見與公平性、可解釋性黑箱問題、以及對社會就業(yè)結構的沖擊等。這些問題需要技術、倫理、法律等多學科協(xié)同解決。效果對比一目了然原生分割器切分混亂第一個塊就過長第二個塊從句子中間開始列表項如“2. 計算機視覺”被割裂在不同的塊中重疊部分毫無意義。增強分割器語義完整每個 chunk 基本以完整的句子或段落結束。列表保護列表項1. 機器學習...和2. 計算機視覺...被完整地保留在同一個或相鄰的 chunk 中并通過智能重疊Chunk 2 開頭重復了 Chunk 1 的最后一句保持了連貫性。重疊有效重疊部分如“其子領域深度學習...進展。”是完整的句子提供了真正的上下文。6. 常見問題與排查技巧實錄在實際使用中你可能會遇到一些其他問題。這里記錄幾個我踩過的坑和解決方案。6.1 性能與長文檔處理問題當處理非常大的單文檔如整本書時預處理和遞歸切分可能比較慢。排查與解決分析瓶頸使用 Python 的cProfile模塊或簡單計時發(fā)現(xiàn)大部分時間花在遞歸調(diào)用和字符串操作上。優(yōu)化策略分而治之對于超長文本先按章節(jié)標題如#,##、頁碼等明顯標記進行粗粒度分割再對每個章節(jié)應用我們的增強分割器。限制遞歸深度在自定義分隔符列表中確保有足夠多的有效分隔符避免算法頻繁回退到最細粒度的分隔符如逗號。可以適當增加。等中文句末標點的權重??紤]流式處理如果文檔是流式輸入的可以設計一個緩沖區(qū)積累文本到一定大小如 2-3 倍 chunk_size就觸發(fā)一次切分而不是等全部加載完。6.2 特殊符號與格式處理問題文檔中包含代碼塊、數(shù)學公式、URL、電子郵件地址等這些內(nèi)容不應該被標點符號分割。排查與解決現(xiàn)象一個 URLhttps://example.com/path?query1可能在://或.處被切斷。增強預處理在_protect_list_structures方法中可以加入對常見特殊模式的保護。使用正則表達式匹配這些模式并用臨時占位符替換在切分后再恢復。def _protect_special_patterns(self, text: str) - str: patterns_to_protect [ (rhttps?://\S, __URL__), (r\b[\w\.-][\w\.-]\.\w\b, __EMAIL__), (r[^], __INLINE_CODE__), # 行內(nèi)代碼 # 可以添加更多模式如簡單數(shù)學公式 $...$ ] protected_text text placeholder_map {} for i, (pattern, placeholder_base) in enumerate(patterns_to_protect): matches list(re.finditer(pattern, protected_text)) for j, match in enumerate(matches): full_placeholder f{placeholder_base}_{i}_{j}__ placeholder_map[full_placeholder] match.group() protected_text protected_text.replace(match.group(), full_placeholder, 1) self._placeholder_map placeholder_map # 存儲起來以便恢復 return protected_text記得在_restore_list_structures之后調(diào)用一個_restore_special_patterns來替換回原始內(nèi)容。6.3 Chunk Size 的“水分”與精確控制問題你設定chunk_size500但實際生成的 chunk 長度經(jīng)常是 480 或 520不太穩(wěn)定。排查與解決原因RecursiveCharacterTextSplitter的length_function默認是len即字符數(shù)。但很多嵌入模型如 OpenAI text-embedding-ada-002有 Token 數(shù)限制。中文字符的 Token 數(shù)通常大于1。解決方案使用 Token 計數(shù)將length_function設置為一個 Token 計數(shù)器。例如使用tiktoken針對 OpenAI 模型或transformers庫的 tokenizer。import tiktoken enc tiktoken.get_encoding(cl100k_base) # OpenAI 嵌入模型用的編碼 def tiktoken_len(text: str) - int: return len(enc.encode(text)) splitter ChineseRecursiveTextSplitter( chunk_size500, # 現(xiàn)在指的是約500個tokens chunk_overlap50, length_functiontiktoken_len, )理解“軟限制”文本分割器的chunk_size是一個“軟限制”。算法會優(yōu)先保證語義完整性所以最終 chunk 可能略超或不足。這是正常且期望的行為。關鍵在于確保大部分 chunk 在目標 Token 數(shù)附近并且語義是完整的。6.4 與其他 LangChain 組件的集成問題自定義的 Splitter 如何與CharacterTextSplitter或TokenTextSplitter等其他 LangChain 分割器結合解決我們的ChineseRecursiveTextSplitter繼承自RecursiveCharacterTextSplitter而后者又繼承自TextSplitter基類。因此它完全兼容 LangChain 的DocumentLoader、Vectorstore等組件。你可以像使用任何官方分割器一樣使用它from langchain.document_loaders import TextLoader from langchain.embeddings import OpenAIEmbeddings from langchain.vectorstores import Chroma loader TextLoader(my_doc.txt) documents loader.load() text_splitter ChineseRecursiveTextSplitter(chunk_size500, chunk_overlap50) split_docs text_splitter.split_documents(documents) # 直接使用 embeddings OpenAIEmbeddings() vectorstore Chroma.from_documents(split_docs, embeddings)7. 進階優(yōu)化與擴展思路基礎的修復方案已經(jīng)能解決大部分問題。如果你對效果有更高要求可以考慮以下方向進行擴展7.1 集成語義分割模型對于追求極致分割質量且不計較成本的場景可以集成基于深度學習的中文語義分割模型。思路是先用我們的規(guī)則方法進行粗分然后對邊界模糊的 chunk調(diào)用輕量級模型判斷此處是否是一個好的分割點。模型選擇可以考慮像BERT或RoBERTa做序列標注判斷每個字符后是否是分割邊界或者使用專門用于文本分割的模型?;旌喜呗砸?guī)則分割快模型分割準??梢栽O定一個置信度閾值只有當規(guī)則分割的邊界得分低于閾值時才調(diào)用模型進行裁決。這樣在保證大部分文檔高速處理的同時提升了關鍵位置的切分準確性。7.2 動態(tài)重疊策略我們當前的智能重疊是固定大小的。更高級的策略可以是動態(tài)的基于內(nèi)容的重疊如果檢測到兩個 chunk 之間涉及話題轉換可通過嵌入向量余弦相似度快速計算則增加重疊量如果話題連貫則減少重疊。基于實體連續(xù)性的重疊使用 NER 工具識別 chunk 邊界處的命名實體如人名、地名、機構名。如果實體被切斷則調(diào)整重疊以確保實體完整出現(xiàn)在一個 chunk 中。7.3 多粒度分割與混合檢索這是 RAG 系統(tǒng)的一個高級技巧。不要只生成一種尺寸的 chunk。并行生成用不同的chunk_size如 200, 500, 1000對同一份文檔進行分割得到細、中、粗三種粒度的文檔塊。混合檢索檢索時可以同時查詢這三種粒度的向量庫。細粒度 chunk 可能更精準匹配問題中的細節(jié)粗粒度 chunk 能提供更完整的背景。然后將所有檢索結果去重、排序、合并后交給大模型。這種方法能顯著提升 RAG 回答的準確性和上下文豐富度。實現(xiàn)上你可以創(chuàng)建三個不同的ChineseRecursiveTextSplitter實例分別處理文檔然后將所有 chunk 存入同一個向量庫但需要添加一個granularity元數(shù)據(jù)字段以便區(qū)分或者在檢索時進行融合。文本切分是 RAG 流水線中沉默的基石它的質量直接決定了天花板的高度。這次對RecursiveCharacterTextSplitter中文缺陷的深挖和修復讓我深刻體會到在擁抱強大工具的同時也必須對其在特定場景下的局限性保持警惕。沒有一勞永逸的解決方案最好的工具永遠是那個你充分理解并能因地制宜進行改造的工具。希望這篇長文能幫你掃清中文文本處理中的一個重大障礙讓你的 RAG 應用回答得更準、更穩(wěn)。