1. 项目背景与核心价值中华古诗词作为传统文化瑰宝蕴含着丰富的历史信息和情感表达。这个毕业设计项目通过Python技术栈构建了一个融合知识图谱、情感分析和AI创作的综合性系统。我在实际开发中发现这种多维度的技术整合能够突破传统诗词研究的局限——比如过去分析李清照《声声慢》只能依赖人工标注情感词现在通过知识图谱可以直观看到梧桐-细雨-愁绪的意象关联链结合情感分析模型能自动识别出87.6%的婉约派词作中的忧郁情绪。关键提示项目最大的创新点在于将Neo4j图数据库的动态关联能力与BERT模型的语义理解相结合这是2023年NLP领域较前沿的应用方向2. 技术架构详解2.1 知识图谱构建流水线数据采集阶段特别要注意诗词网站的防爬策略。我使用ScrapyRotatingProxy组合爬取古诗文网时通过以下配置有效避免封禁class PoetrySpider(scrapy.Spider): custom_settings { DOWNLOAD_DELAY: 2, ROTATING_PROXY_LIST: [ip1:port,ip2:port], USER_AGENT: Mozilla/5.0 (Windows NT 10.0) }实体关系抽取采用BERT-BiLSTM-CRF模型在标注了5000条古诗文语料后达到92.3%的F1值。这里有个细节处理对于明月几时有这样的诗句需要先进行明月/几时/有的正确分词否则会误判明月几为实体。2.2 情感分析模型优化传统情感词典方法在古诗场景准确率仅68%我们采用以下改进方案基于《知网》情感词典扩展300个古诗专用情感词使用LoRA技术微调BERT模型引入注意力机制捕捉却道天凉好个秋这类反讽表达训练参数设置值得注意trainer Trainer( modelmodel, argsTrainingArguments( per_device_train_batch_size8, learning_rate3e-5, num_train_epochs5, lora_rank64 # LoRA矩阵秩的优化值 ) )3. 可视化系统实现3.1 Neo4j图数据库设计设计Schema时踩过一个坑最初将意象节点直接关联情感后发现应该通过作品中转。优化后的Cypher查询示例MATCH (p:Poet)-[:WRITE]-(w:Work)-[:CONTAIN]-(i:Image) WHERE i.name月亮 RETURN p.name, w.title, i.emotion3.2 前端交互优化使用ECharts实现的三重可视化方案力导向图展示诗人社交网络热力图呈现不同朝代情感分布词云突出高频意象实测发现超过500个节点时需要启用WebWorker进行异步渲染否则会卡顿。这里有个性能优化技巧const worker new Worker(graphWorker.js); worker.postMessage({nodes: filteredNodes}); worker.onmessage (e) { chart.setOption(e.data); }4. 智能问答系统开发4.1 问答引擎架构采用RAGRetrieval-Augmented Generation模式结合传统检索和AI生成的优势。具体流程用户输入李白描写月亮的诗Neo4j检索相关作品大模型生成结构化回答关键配置参数retriever: top_k: 5 score_threshold: 0.65 generator: temperature: 0.7 max_length: 3004.2 自动写诗模块基于GPT-3的few-shot learning实现prompt设计很有讲究。例如生成边塞诗时有效的prompt结构【示例1】 标题从军行 内容青海长云暗雪山... 风格豪迈雄壮 【示例2】 标题凉州词 内容葡萄美酒夜光杯... 风格悲壮苍凉 请根据以上示例风格创作新的边塞诗主题要求${user_input}5. 部署与性能调优5.1 后端API优化使用FastAPI构建的接口需要进行以下关键配置app FastAPI( titlePoetry API, middleware[ Middleware(GZipMiddleware), Middleware(HTTPSRedirectMiddleware) ] ) app.get(/poem/{poem_id}) async def get_poem(poem_id: int): # 添加缓存装饰器 cache(expire300) def query_db(): return neo4j_query(...)5.2 大模型轻量化为了让7B参数的模型能在消费级GPU运行我们采用以下技术组合4-bit量化bitsandbytes库梯度检查点gradient_checkpointing使用FlashAttention加速实测在RTX 3090上推理速度从15s/首提升到3s/首内存占用从24GB降到8GB。6. 典型问题解决方案6.1 知识图谱更新问题初期采用全量更新导致服务中断后来改为增量更新方案使用Apache Kafka作为消息队列设计变更数据捕获CDC管道实现凌晨2点的定时增量同步6.2 情感分析歧义处理对于却道天凉好个秋这类复杂表达我们建立歧义处理规则上下文窗口扩展到前后5句引入反讽检测子模型人工标注2000条歧义样本进行强化训练最终将这类case的准确率从54%提升到82%。7. 项目扩展方向在实际部署后我们发现三个有价值的扩展点添加声韵分析模块用LSTM预测诗句平仄结合CLIP模型实现诗画互译功能开发移动端AR应用扫描实物触发相关诗词特别是第三个方向当用户拍摄真实场景中的月亮时AR界面可以浮现相关的咏月诗句这个功能在文旅场景很有应用前景。