6c1a69af0d
Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2.4 KiB
2.4 KiB
配置完成总结
✅ 已完成的配置
1. 硅基流动API配置
- ✅ API密钥已配置:
sk-pvvtosiglncktlucwarxilvsypqcttqizgpcfdvodgcuaezn - ✅ API端点:
https://api.siliconflow.cn/v1 - ✅ 环境变量已设置(
.env文件)
2. 模型配置
项目已配置为使用以下两个硅基流动模型:
NER(命名实体识别)
- 模型:
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B - 配置文件:
src/extraction/ner.py - 状态: ✅ 已测试,可用
RE(关系抽取)- 多模型并行
- 模型1:
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B - 模型2:
Qwen/Qwen2.5-7B-Instruct - 配置文件:
src/extraction/re.py - 状态: ✅ 已测试,两个模型都可用
社区摘要生成
- 模型:
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B - 配置文件:
src/kg_builder/indexer.py - 状态: ✅ 已配置
3. 环境修复
- ✅ 虚拟环境已重新创建
- ✅ 所有依赖包已安装(92个包)
- ✅ 修复了conda环境路径干扰问题
📊 快速测试结果
测试了2个TextUnit的完整流程:
成功指标
- ✅ 文档解析:成功
- ✅ 实体识别(NER):成功(使用deepseek-ai/DeepSeek-R1-Distill-Qwen-7B)
- ✅ 关系抽取(RE):成功(两个模型并行运行)
- ✅ 知识图谱构建:成功
- 节点数:67个
- 边数:63条
- 三元组数:63个
- ✅ 社区检测:成功(11个社区)
- ⚠️ 社区摘要生成:部分成功(需要更长时间,但已修复配置)
🚀 运行完整流程
完整流程正在后台运行,处理3个文档:
cd E:\Project\2025_LawGraph\dofile
.venv\Scripts\python.exe scripts\complete_pipeline.py --data-dir ../data/1法律 --output-dir ./output --max-docs 3
预计运行时间:由于需要处理62个TextUnit,每个都需要调用LLM API,可能需要10-30分钟。
📁 输出文件
流程完成后,将生成:
output/knowledge_graph.json: 知识图谱文件output/knowledge_graph_stats.json: 统计信息
🔍 验证模型
运行以下命令验证模型配置:
.venv\Scripts\python.exe tests\test_my_models.py
📝 下一步
- 等待完整流程完成
- 查看生成的知识图谱文件
- 可以尝试查询功能:
.venv\Scripts\python.exe scripts/query_kg.py --kg output/knowledge_graph.json --query "乡村振兴" --mode global
配置已完成,项目已就绪!🎉