Files
SI_KG_2026_PlanningLaw/dofile/graphrag_pipeline/CONFIGURATION_COMPLETE.md
T

2.4 KiB
Raw Blame History

配置完成总结

已完成的配置

1. 硅基流动API配置

  • API密钥已配置:sk-pvvtosiglncktlucwarxilvsypqcttqizgpcfdvodgcuaezn
  • API端点:https://api.siliconflow.cn/v1
  • 环境变量已设置(.env文件)

2. 模型配置

项目已配置为使用以下两个硅基流动模型:

NER(命名实体识别)

  • 模型: deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
  • 配置文件: src/extraction/ner.py
  • 状态: 已测试,可用

RE(关系抽取)- 多模型并行

  • 模型1: deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
  • 模型2: Qwen/Qwen2.5-7B-Instruct
  • 配置文件: src/extraction/re.py
  • 状态: 已测试,两个模型都可用

社区摘要生成

  • 模型: deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
  • 配置文件: src/kg_builder/indexer.py
  • 状态: 已配置

3. 环境修复

  • 虚拟环境已重新创建
  • 所有依赖包已安装(92个包)
  • 修复了conda环境路径干扰问题

📊 快速测试结果

测试了2个TextUnit的完整流程:

成功指标

  • 文档解析:成功
  • 实体识别(NER):成功(使用deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
  • 关系抽取(RE):成功(两个模型并行运行)
  • 知识图谱构建:成功
    • 节点数:67个
    • 边数:63条
    • 三元组数:63个
  • 社区检测:成功(11个社区)
  • ⚠️ 社区摘要生成:部分成功(需要更长时间,但已修复配置)

🚀 运行完整流程

完整流程正在后台运行,处理3个文档:

cd E:\Project\2025_LawGraph\dofile
.venv\Scripts\python.exe scripts\complete_pipeline.py --data-dir ../data/1法律 --output-dir ./output --max-docs 3

预计运行时间:由于需要处理62个TextUnit,每个都需要调用LLM API,可能需要10-30分钟。

📁 输出文件

流程完成后,将生成:

  • output/knowledge_graph.json: 知识图谱文件
  • output/knowledge_graph_stats.json: 统计信息

🔍 验证模型

运行以下命令验证模型配置:

.venv\Scripts\python.exe tests\test_my_models.py

📝 下一步

  1. 等待完整流程完成
  2. 查看生成的知识图谱文件
  3. 可以尝试查询功能:
    .venv\Scripts\python.exe scripts/query_kg.py --kg output/knowledge_graph.json --query "乡村振兴" --mode global
    

配置已完成,项目已就绪!🎉