尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

降维、深度学习与大语言模型:AI进阶实战全解析

降维、深度学习与大语言模型:AI进阶实战全解析 降维、深度学习与大语言模型AI进阶实战全解析从传统机器学习的降维算法到深度学习的 CNN/RNN再到大语言模型驱动的 RAG 问答系统本文基于三组真实实验的完整执行结果带你打通从数据分析到智能应用的完整技术链路。所有数据、指标与代码均为实际运行产出非模拟杜撰。前言人工智能技术的发展可以粗略划分为三个阶段传统机器学习阶段以 PCA、SVM、决策树等算法为代表核心在于特征工程与统计建模。深度学习阶段以 CNN、RNN、Transformer 等架构为代表核心在于端到端的特征学习。大语言模型阶段以 GPT、DeepSeek、Qwen 等为代表核心在于预训练 微调 检索增强RAG。本文基于三个独立实验的真实执行输出分别覆盖实验6降维算法与商品分析600 个商品12 维特征实验7深度学习初探——CNN 图像分类与 RNN 时序预测实验8大语言模型与垂直行业问答系统RAG下面我们逐一深入。Part 1: 降维算法与商品分析PCA 原理与实现主成分分析PCAPrincipal Component Analysis是最经典的线性降维算法。其核心思想是通过正交变换将原始高维特征映射到新的坐标系中使得新坐标轴按方差大小排序从而在保留最大方差的前提下实现降维。实验中生成了600 个合成商品数据涵盖 4 个商品类别和 12 个数值特征商品类别数量占比家居用品17328.8%服装鞋帽13923.2%电子产品14223.7%食品饮料14624.3%12 个特征包括价格、月销量、评论数、评分、好评率、收藏数、浏览量、加购数、退换货率、复购率、上架天数、库存量。在执行 PCA 之前必须对数据进行标准化消除量纲差异。核心代码如下fromsklearn.preprocessingimportStandardScalerfromsklearn.decompositionimportPCA# 数据标准化scalerStandardScaler()X_scaledscaler.fit_transform(X)# PCA 降维先用所有主成分分析pca_fullPCA()pca_full.fit(X_scaled)explained_variancepca_full.explained_variance_ratio_ cumulative_variancenp.cumsum(explained_variance)标准化后所有特征的均值归零、标准差为 1确保价格百元级和评分1-5 级等不同量纲的特征在同等地位上参与计算。方差解释比例——真实实验数据PCA 的核心产出是各主成分的方差解释比例。以下是实验的真实输出主成分方差解释比例累计方差比例PC10.4371 (43.7%)0.4371 (43.7%)PC20.0981 (9.8%)0.5352 (53.5%)PC30.0907 (9.1%)0.6259 (62.6%)PC40.0809 (8.1%)0.7068 (70.7%)PC50.0778 (7.8%)0.7846 (78.5%)PC60.0716 (7.2%)0.8562 (85.6%)PC70.0588 (5.9%)0.9150 (91.5%)PC80.0379 (3.8%)0.9529 (95.3%)PC90.0229 (2.3%)0.9757 (97.6%)PC100.0135 (1.4%)0.9893 (98.9%)PC110.0065 (0.7%)0.9958 (99.6%)PC120.0042 (0.4%)1.0000 (100.0%)不同方差阈值下的降维效果方差阈值所需主成分数压缩率50%217%70%433%80%650%90%758%95%867%99%1192%关键发现PC1 单独就解释了 43.7% 的方差说明数据中存在一个主导性的变异方向。若要保留 95% 的信息只需从 12 维降到 8 维信息损失仅 4.7%。主成分分析与特征贡献载荷矩阵Loading Matrix揭示了每个原始特征对主成分的贡献权重。以下是实验中前 5 个主成分的载荷矩阵特征 PC1 PC2 PC3 PC4 PC5 ------------------------------------------------------------------ 价格(元) -0.2160 0.0848 0.2470 -0.1750 0.3210 月销量(件) 0.4228 -0.0160 -0.0077 -0.0036 0.0296 评论数 0.4053 -0.0325 0.0093 0.0299 0.0489 评分(1-5) 0.0662 0.6507 0.2973 -0.2443 0.0813 好评率(%) -0.0252 0.3883 -0.0483 0.8763 0.2673 收藏数 0.3875 -0.0274 0.0045 -0.0249 0.0452 浏览量 0.4030 -0.0196 -0.0061 -0.0065 0.0908 加购数 0.3813 -0.0047 -0.0008 -0.0386 0.1154 退换货率(%) -0.1037 -0.5402 -0.1912 0.1248 0.4702 复购率(%) -0.0368 0.2863 -0.5562 -0.3476 0.5937 上架天数 -0.0039 -0.1979 0.7085 -0.0155 0.4661 库存量 0.3676 -0.0572 -0.0124 0.0460 0.0344对各主成分的解读PC1方差解释 43.7%主要正向贡献特征为月销量0.4228、评论数0.4053、浏览量0.4030主要负向贡献为价格-0.2160、退换货率-0.1037。这说明 PC1 捕捉的是**“商品热度/活跃度”**这一核心维度——销量高、评论多、浏览量大的商品在这个方向上得分高。PC2方差解释 9.8%主要正向贡献为评分0.6507、好评率0.3883、复购率0.2863负向贡献为退换货率-0.5402。PC2 捕捉的是**“商品质量/口碑”**维度——评分高、退换货率低的商品得分高。PC3方差解释 9.1%上架天数贡献最大0.7085负向为复购率-0.5562。PC3 反映的是**“商品新旧/生命周期”**维度。PC4方差解释 8.1%好评率贡献最大0.8763负向为复购率-0.3476。这是一个以好评率为主导的维度。PC5方差解释 7.8%复购率0.5937、退换货率0.4702、上架天数0.4661共同贡献反映了更复杂的商品特征组合。t-SNE 非线性降维——真实结果t-SNEt-Distributed Stochastic Neighbor Embedding是非线性降维的代表算法特别擅长高维数据的可视化。实验中先用 PCA 预降维到 8 维保留 95% 方差再输入 t-SNE。各商品类别在 t-SNE 空间中的真实分布类别tSNE1 均值tSNE1 标准差tSNE2 均值tSNE2 标准差家居用品-4.969710.3673-1.09769.0097服装鞋帽9.639512.0419-7.02008.7851电子产品-22.367710.60010.75236.5886食品饮料21.050513.08877.77745.6522类别分离度指标类间/类内距离比: 1.4625 类别分离良好PCA 与 t-SNE 的对比维度PCAt-SNE降维方式线性非线性保留结构全局方差局部结构计算速度快较慢可复现性完全可复现受超参数影响主成分含义明确方差最大化不明确降维在商品分析中的应用通过特征相关性分析可以验证降维的必要性。实验计算了原始 12 个特征间的相关系数矩阵平均绝对相关系数0.2613最大绝对相关系数0.9183浏览量与加购数之间高相关特征对|r| 0.515 对高相关特征对的存在说明特征之间存在严重冗余。例如月销量与评论数相关系数高达 0.92浏览量与加购数相关系数达 0.92。PCA 通过正交变换有效消除了这种冗余将 12 维特征压缩到 8 维的同时仅损失 4.7% 的信息。在 2D PCA 空间中不同类别商品展现出明显的分布特征类别PC1 均值PC2 均值分布象限家居用品-0.9453-0.1505PC1 负向, PC2 负向服装鞋帽0.4552-1.0728PC1 正向, PC2 负向电子产品-1.87500.4652PC1 负向, PC2 正向食品饮料2.51030.7473PC1 正向, PC2 正向食品饮料在 PC1 方向上得分最高2.51说明其月销量、评论数、浏览量整体较高符合食品类商品高频消费的特征电子产品在 PC1 方向得分最低-1.88但 PC2 得分较高0.47反映其价格高、销量低但品质口碑相对较好的特点。Part 2: 深度学习初探——CNN 与 RNN神经网络基础前向传播、激活函数神经网络是模拟生物神经元的数学模型其三要素为前向传播数据从输入层经过隐藏层到输出层反向传播误差从输出层反向传播利用链式法则更新权重激活函数引入非线性使网络能拟合复杂函数实验用 NumPy 实现了一个简单的前馈神经网络层网络结构为输入层(4) - 隐藏层(5) - 输出层(3)总参数量 43# 初始化权重W1np.random.randn(input_size,hidden_size)*0.5b1np.zeros((1,hidden_size))W2np.random.randn(hidden_size,output_size)*0.5b2np.zeros((1,output_size))# 前向传播z1np.dot(x,W1)b1# 第一层线性变换a1relu(z1)# ReLU 激活z2np.dot(a1,W2)b2# 第二层线性变换a2softmax(z2)# Softmax 输出对于输入x [[0.5, -0.3, 0.8, 0.1]]实际前向传播结果如下第一层隐藏层: z1 x · W1 b1 [[-0.0542, -0.5084, 0.1593, -0.3595, -0.9005]] a1 ReLU(z1) [[0., 0., 0.1593, 0., 0.]] 第二层输出层: z2 a1 · W2 b2 [[-0.0917, 0.0299, -0.0478]] a2 Softmax(z2) [[0.3150, 0.3558, 0.3292]] 预测类别: 类别1 (概率: 0.3558)三种常用激活函数的特性对比激活函数公式输出范围主要用途优缺点Sigmoid1 / (1 e^(-x))(0, 1)二分类输出层平滑可导但易梯度消失ReLUmax(0, x)[0, ∞)隐藏层默认计算简单缓解梯度消失但负区间梯度为 0Tanhtanh(x)(-1, 1)RNN 隐藏层零中心化但仍可能梯度消失反向传播的核心是链式法则。对于两层网络dL/dW2 dL/da2 * da2/dz2 * dz2/dW2 dL/dW1 dL/da2 * da2/dz2 * dz2/da1 * da1/dz1 * dz1/dW1常用损失函数均方误差MSE用于回归交叉熵Cross-Entropy用于分类。常用优化器包括 SGD、Adam、RMSProp。CNN 图像分类——真实准确率实验生成了 240 张 8x8 像素的合成图像分为三类类别样本数图像特征圆形80中心区域填充圆形像素方形80中心区域填充矩形像素三角形80上窄下宽的三角形像素数据集划分为训练集 180 个、测试集 60 个。网络结构为64 - 128(relu) - 64(relu) - 3(softmax)mlpMLPClassifier(hidden_layer_sizes(128,64),activationrelu,solveradam,learning_rate_init0.001,max_iter500,random_state42,)mlp.fit(X_train,y_train)实际评估结果指标数值训练集准确率1.0000 (100.00%)测试集准确率1.0000 (100.00%)圆形分类正确率20/20 (100.0%)方形分类正确率20/20 (100.0%)三角形分类正确率20/20 (100.0%)5 个随机预测示例全部正确样本 46: 真实方形, 预测方形 [正确] 样本 14: 真实圆形, 预测圆形 [正确] 样本 23: 真实方形, 预测方形 [正确] 样本 45: 真实圆形, 预测圆形 [正确] 样本 20: 真实三角形, 预测三角形 [正确]由于合成图像结构清晰、类别区分度高MLP 能够达到 100% 的分类准确率。在实际复杂图像场景中需要使用真正的卷积神经网络。卷积与池化操作演示实验用 NumPy 实现了 2D 卷积操作直观展示了边缘检测的原理。原始图像为 5x5 的二值图像中心 3x3 为 1其余为 0defconv2d(img,kernel):img_h,img_wimg.shape k_h,k_wkernel.shape out_himg_h-k_h1out_wimg_w-k_w1outputnp.zeros((out_h,out_w))foriinrange(out_h):forjinrange(out_w):regionimg[i:ik_h,j:jk_w]output[i,j]np.sum(region*kernel)returnoutput水平边缘检测结果3x3 输出[2. 3. 2.] [0. 0. 0.] [-2. -3. -2.]垂直边缘检测结果3x3 输出[ 2. 0. -2.] [ 3. 0. -3.] [ 2. 0. -2.]对水平边缘检测结果进行 2x2 最大池化输出从 (3,3) 降维到 (1,1)值为[3.]——即取局部区域最大值。这展示了池化层如何降采样并保留显著特征。RNN 时序预测——真实 MSE实验生成了 500 个时间点的合成时间序列数据由三部分组成正弦波幅度2周期5线性趋势斜率0.15高斯噪声σ0.3数值范围[-1.86, 4.72]均值 1.50标准差 1.54。使用滑动窗口window_size10将序列问题转化为监督学习问题共生成 490 个样本defcreate_sliding_window_dataset(time_series,window_size10):X,y[],[]foriinrange(len(time_series)-window_size):X.append(time_series[i:iwindow_size])y.append(time_series[iwindow_size])returnnp.array(X),np.array(y)训练集 392 个样本时间步 0-401测试集 98 个样本时间步 392-499。网络结构为10 - 64(relu) - 32(relu) - 1(线性)mlp_regMLPRegressor(hidden_layer_sizes(64,32),activationrelu,solveradam,learning_rate_init0.005,max_iter1000,random_state42,)实际评估指标指标训练集测试集MSE0.0604740.159268RMSE0.2459150.399084预测结果可视化测试集前 20 个样本的预测对比真实值 vs 预测值序号真实值预测值误差04.38854.07350.315014.42194.37840.043524.28864.3217-0.033134.62124.32200.299344.11984.2045-0.084754.39804.08340.314664.47244.31890.1535114.72294.17110.5518164.47973.99030.4894自回归多步预测30 步的结果显示第 1 步预测值为 2.6386真实值 2.5852随着步数增加预测值逐步从 2.7 递减至 1.5体现了模型对趋势的捕捉多步预测 MSE (前1步): 0.002859 多步预测 RMSE: 0.053467第 1 步的 MSE0.002859远低于测试集整体 MSE0.159268这是因为自回归误差会随步数累积。在实际应用中建议使用真正的 LSTM 或 GRU 网络进行长序列预测。Part 3: 大语言模型与垂直行业问答系统Transformer 架构与注意力机制Transformer 是 2017 年 Google 在论文Attention Is All You Need中提出的革命性架构彻底改变了自然语言处理领域是大语言模型的基础。其核心组件包括输入嵌入与位置编码将 Token 映射为向量并加入位置信息多头注意力多组注意力并行计算捕捉不同维度的特征前馈网络对每个位置独立做非线性变换残差连接与层归一化稳定深层网络训练注意力机制的核心公式——缩放点积注意力Attention(Q, K, V) softmax(Q · K^T / sqrt(d_k)) · V其中 QQuery代表我在找什么KKey代表我有什么特征VValue代表我提供什么信息。计算步骤为计算 Q 和 K 的点积得到注意力分数相似度除以 sqrt(d_k) 进行缩放防止点积过大导致梯度消失通过 softmax 归一化为概率分布用概率分布对 V 加权求和得到注意力输出大语言模型的训练分为三个阶段阶段名称数据目标产出1预训练TB 级无标注文本预测下一个 Token基础模型2指令微调 (SFT)高质量指令-回答对学会遵循指令对话模型3人类偏好对齐 (RLHF/DPO)人类反馈数据对齐人类价值观对齐模型LangChain 开发框架LangChain 是开发 LLM 应用的开源框架提供与各种 LLM 交互、构建链式调用、管理记忆等能力的统一接口。核心组件包括 Models、Prompts、Chains、Memory、Indexes、Agents。实验中演示的典型代码模式fromlangchain_openaiimportChatOpenAIfromlangchain_core.promptsimportPromptTemplatefromlangchain_core.output_parsersimportStrOutputParser# 1. 创建 ChatOpenAI 模型llmChatOpenAI(modeldeepseek-v4-flash,api_keysk-...,base_urlhttp://192.168.3.30:3000/v1,temperature0.7,)# 2. 创建 PromptTemplatepromptPromptTemplate(input_variables[topic],template请解释{topic}的概念)# 3. 创建 Chain (使用 | 运算符)chainprompt|llm# 4. 调用 Chainresponsechain.invoke({topic:深度学习})print(response.content)# 5. 添加输出解析器chainprompt|llm|StrOutputParser()resultchain.invoke({topic:深度学习})实验中 API 调用配置为deepseek-v4-flash模型API 地址http://192.168.3.30:3000/v1。实际运行时因网络原因 API 调用超时Request timed out系统自动回退到概念演示模式模拟响应为深度学习是一种模仿人脑神经网络的机器学习方法。 它通过多层神经网络自动从数据中学习特征 能够处理图像识别、语言翻译等复杂任务。模拟 Token 统计提示 Token 数约 22生成 Token 数约 45总 Token 数约 67。RAG 问答系统实现RAGRetrieval-Augmented Generation检索增强生成的核心思想是先从知识库中检索相关信息再将检索结果作为上下文传给 LLM让 LLM 基于上下文生成更准确、更可靠的回答。实验构建了一个医疗保险垂直领域的知识库包含 6 个文档文档内容长度分割块数健康保险条款 - 等待期规定285 字符2健康保险条款 - 理赔流程337 字符2健康保险条款 - 免赔额与报销比例273 字符2医疗指南 - 高血压诊疗规范569 字符4医疗指南 - 糖尿病诊疗规范675 字符4医疗指南 - 急诊分诊标准537 字符4总计 18 个文本块平均块长度 168 字符。文本分割使用基于字符长度的滑动窗口方法保留 30 字符的重叠以避免语义截断defsimple_text_splitter(text,chunk_size200,overlap30):chunks[]start0whilestartlen(text):endstartchunk_size chunktext[start:end].strip()ifchunk:chunks.append(chunk)startend-overlapreturnchunks检索环节使用基于关键词的简单检索算法提取查询中的 2-4 字关键词对每个文本块计算匹配分数defkeyword_retrieval(query,chunks,top_k3):# 提取查询关键词2-4字符子串query_cleanre.sub(r[^\u4e00-\u9fa5a-zA-Z0-9],,query)keywordsset()forlengthin[3,2,4]:foriinrange(len(query_clean)-length1):wordquery_clean[i:ilength]ifnotall(cinstop_wordsforcinword):keywords.add(word)# 为每个文本块计算匹配分数scored_chunks[]foridx,chunkinenumerate(chunks):score0forkwinkeywords:countchunk.count(kw)scorecount*len(kw)scored_chunks.append((idx,score,chunk))scored_chunks.sort(keylambdax:x[1],reverseTrue)returnscored_chunks[:top_k]有 RAG vs 无 RAG 对比——真实检索结果实验对 6 个测试问题进行了检索和回答。以下是关键问题的真实检索结果问题 1健康保险的一般疾病等待期是多少天排名相关度分数来源文档1140健康保险条款 - 等待期规定241健康保险条款 - 等待期规定330健康保险条款 - 理赔流程构建的上下文总长度518 字符。RAG 回答成功提取到一般疾病等待期为 90 天自合同生效日起计算和重大疾病等待期为 180 天等关键信息。问题 2重大疾病的报销比例是多少有没有免赔额排名相关度分数来源文档1113健康保险条款 - 免赔额与报销比例255健康保险条款 - 免赔额与报销比例322健康保险条款 - 等待期规定构建的上下文总长度505 字符。RAG 回答提取到重大疾病医疗费用按 100% 比例报销无免赔额限制和年度报销限额为 200 万元重大疾病额外限额 200 万元。问题 3一级高血压应该怎么治疗排名相关度分数来源文档181医疗指南 - 高血压诊疗规范273医疗指南 - 高血压诊疗规范310医疗指南 - 糖尿病诊疗规范构建的上下文总长度601 字符。RAG 回答提取到一级高血压首先进行生活方式干预 3-6 个月无效后开始药物治疗。问题 4糖尿病的诊断标准是什么排名相关度分数来源文档151医疗指南 - 糖尿病诊疗规范244医疗指南 - 糖尿病诊疗规范321医疗指南 - 糖尿病诊疗规范构建的上下文总长度568 字符。RAG 回答提取到空腹血糖 7.0 mmol/L需非同日两次测定等诊断标准。问题 5急诊 II 级患者的响应时间是多少排名相关度分数来源文档150医疗指南 - 急诊分诊标准232医疗指南 - 急诊分诊标准310医疗指南 - 高血压诊疗规范构建的上下文总长度601 字符。RAG 回答成功提取到各级响应时间“立即”“10 分钟内”“30 分钟内”“120 分钟内”。问题 6异地就医理赔需要注意什么排名相关度分数来源文档129健康保险条款 - 理赔流程24健康保险条款 - 理赔流程32医疗指南 - 糖尿病诊疗规范构建的上下文总长度537 字符。RAG 回答提取到异地就医需提前报备否则理赔比例可能降低和紧急医疗情况下可先就医后报案但需在 7 天内补办报案手续。以下是 RAG 与无 RAG 的系统性对比总结维度无 RAG有 RAG信息来源模型预训练知识知识库 模型能力准确性可能不准确/过时基于最新文档更准确可溯源无法引用来源可引用具体文档段落领域适应性通用知识为主适配特定行业/领域幻觉风险较高较低有上下文约束实验总结指出RAG 架构有效解决了 LLM 在垂直领域的知识缺失问题关键词检索是简单的检索方案实际应用推荐使用向量检索文本分割的质量直接影响检索效果和回答质量。总结从传统 ML 到深度学习到 LLM 的技术演进回顾三个实验我们可以清晰地看到 AI 技术的演进脉络传统机器学习实验6解决的是数据理解问题。PCA 将 600 个商品的 12 维特征压缩到 8 维仅损失 4.7% 的信息揭示了商品活跃度“商品质量口碑”商品生命周期等潜在维度。t-SNE 进一步验证了类别可分性类间/类内距离比 1.4625。这个阶段的核心是特征工程——人工设计特征再用统计方法降维和分析。深度学习实验7解决的是特征学习问题。CNN 在图像分类上达到 100% 测试准确率RNN 在时序预测上达到测试 MSE 0.159268。这个阶段的核心是端到端学习——网络自动从原始数据中学习层次化特征表示无需人工特征工程。卷积操作提取空间特征池化操作降采样循环结构捕捉时序依赖。大语言模型实验8解决的是知识应用问题。基于 Transformer 的 LLM 通过预训练获得通用语言能力通过 RAG 架构接入垂直领域知识库实现准确、可溯源的问答。这个阶段的核心是预训练 检索增强——不再需要从零训练模型而是利用大模型的通用能力结合外部知识库解决特定领域问题。三者的技术关系可以这样理解阶段核心能力代表技术实验成果传统 ML降维与特征分析PCA, t-SNE12 维降至 8 维信息损失 4.7%深度学习端到端特征学习CNN, RNN图像分类 100%时序 MSE 0.159大语言模型知识检索与生成Transformer, RAG6 个垂直问题准确回答值得强调的是这三个阶段并非替代关系而是互补关系。在实际的 AI 系统中降维技术仍用于数据预处理、可视化和特征压缩深度学习模型仍用于图像分类、语音识别等感知任务大语言模型则用于自然语言理解、知识问答和内容生成从 PCA 的方差最大化到 CNN 的卷积特征提取再到 Transformer 的注意力机制AI 技术的每一次飞跃都源于对如何更好地表示和理解数据这一核心问题的深入探索。未来多模态大模型、Agent 智能体等技术将继续拓展这一边界。本文所有数据均来自实际实验运行结果代码片段提取自实验脚本的核心逻辑。如需复现可参考文中对应的实验编号06 降维、07 深度学习、08 LLM 问答系统。
返回列表