分类高维统计 / 稀疏回归 / 随机矩阵高维建模的第一步不是选算法而是判断任务是否越过信息边界。本节用两个经典模型建立这种边界感加性尖峰模型看低秩信号能否从噪声谱中突出稀疏回归看稀疏度与样本量的相对尺度。1. 加性尖峰模型设观测矩阵为Xλuv∗⊤Z, X\lambda u v_*^{\top}Z,Xλuv∗⊤​Z,其中uuu、v∗v_*v∗​是单位方向ZZZ是噪声矩阵p/n→δp/n\to\deltap/n→δ。我们想知道最大奇异向量v^\hat vv^是否包含v∗v_*v∗​的信息。如图1所示可学性判断可以拆成两条分支。任务判断低秩信号稀疏信号谱峰越界样本充分弱恢复极小极大噪声淹没比例渐近图1 可学性判断树。黄色是输入绿色是可行路径紫色是输出红色是退化路径。2. 谱峰相变把噪声谱画出来最大奇异向量只有在信号峰越过噪声谱右端时才会携带真实方向信息。弱恢复阈值是λδ1/4. \lambda\delta^{1/4}.λδ1/4.越过阈值后相关度满足∣⟨v^,v∗⟩∣2→1−δ/λ41δ/λ2. |\langle \hat v,v_*\rangle|^2 \to \frac{1-\delta/\lambda^4}{1\delta/\lambda^2}.∣⟨v^,v∗​⟩∣2→1δ/λ21−δ/λ4​.把这个公式翻译成谱图分子只有当λ4δ\lambda^4\deltaλ4δ时才为正这正好对应信号峰越过噪声谱。3. 稀疏回归的极小极大最优稀疏线性回归模型为yixi⊤β∗zi,zi∼N(0,σ2). y_ix_i^{\top}\beta_*z_i,\qquad z_i\sim N(0,\sigma^2).yi​xi⊤​β∗​zi​,zi​∼N(0,σ2).当稀疏度满足klog⁡(p/k)n→0 \frac{k\log(p/k)}{n}\to 0nklog(p/k)​→0时总风险尺度上的极小极大误差为2klog⁡(p/k). 2k\log(p/k).2klog(p/k).SLOPE 通过调整逐坐标惩罚达到该最优阶因此它不只是另一个惩罚方法而是针对稀疏度未知问题设计的自适应方法。4. LASSO 的比例渐近当k/p→ϵk/p\to\epsilonk/p→ϵ、n/p→δn/p\to\deltan/p→δ时LASSO 的参数误差不再消失而是由固定点方程决定1p∥β^L−β∗∥2→E[η(BmZ;τm)−B]2. \frac{1}{p}\|\hat\beta^{\mathrm{L}}-\beta_*\|^2 \to \mathbb{E}\big[\eta(BmZ;\tau m)-B\big]^2.p1​∥β^​L−β∗​∥2→E[η(BmZ;τm)−B]2.这里BBB是真实信号分布ZZZ是标准高斯变量τ,m\tau,mτ,m由自洽方程组确定。工程含义很直接算法和调参都正确比例渐近下仍可能存在不可消除的估计偏差。5. 两个例子共同告诉我们的边界问题关键参数边界可学对象尖峰矩阵λ,δ\lambda,\deltaλ,δλδ1/4\lambda\delta^{1/4}λδ1/4弱恢复方向稀疏回归k,p,nk,p,nk,p,nklog⁡(p/k)/n→0k\log(p/k)/n\to0klog(p/k)/n→0极小最大风险LASSOk/p,n/pk/p,n/pk/p,n/p比例渐近固定点风险而非一致性6. 工程判断逐坐标信噪比很低时低秩结构仍可能通过集体放大实现弱恢复。LASSO 不一致不代表算法写错而是稀疏度与样本量进入了新的渐近区域。先判断任务是否越过相变边界再比较算法比直接堆测试集更有价值。在部署中应先计算p/np/np/n、稀疏度占比和谱峰位置再决定模型评估口径。认知检查点尖峰模型看谱峰是否越过噪声谱稀疏回归看稀疏度与样本量的比值两条边界共同构成高维可学性判断入口。附代码实验与输出实验分两部分尖峰矩阵在不同λ\lambdaλ下的弱恢复相关度以及 LASSO 在稀疏区与比例渐近区的逐坐标均方误差。importnumpyasnpfromsklearn.linear_modelimportLassodefspiked_corr(n,p,lam,seed0):rngnp.random.default_rng(seed)urng.normal(sizen);u/np.linalg.norm(u)vrng.normal(sizep);v/np.linalg.norm(v)Zrng.normal(size(n,p))/np.sqrt(n)Xlam*np.outer(u,v)Z _,_,Vtnp.linalg.svd(X,full_matricesFalse)vhatVt[0]returnfloat(abs(np.dot(vhat,v)))print(spiked model: n400, p200, delta0.5, thresholddelta^(1/4)0.8409)forlamin[0.60,0.84,1.20]:print(flambda{lam:.2f}corr{spiked_corr(400,200,lam):.4f})defsparse_case(n,p,k,alpha,seed0):rngnp.random.default_rng(seed)betanp.zeros(p)beta[:k]1.0Xrng.normal(size(n,p))yX betarng.normal(sizen)modelLasso(alphaalpha,max_iter5000)model.fit(X,y)returnfloat(np.mean((model.coef_-beta)**2))print(sparse regression: sparse regime)print(fk5 p200 n300 per_coord_mse{sparse_case(300,200,5,0.02):.4f})print(sparse regression: proportional regime)print(fk50 p200 n120 per_coord_mse{sparse_case(120,200,50,0.05):.4f})实验输出spiked model: n400, p200, delta0.5, thresholddelta^(1/4)0.8409 lambda0.60 corr0.1929 lambda0.84 corr0.3967 lambda1.20 corr0.7493 sparse regression: sparse regime k5 p200 n300 per_coord_mse0.0021 sparse regression: proportional regime k50 p200 n120 per_coord_mse0.0815尖峰矩阵中λ1.20\lambda1.20λ1.20时相关度明显升高稀疏回归中k5k5k5的稀疏区误差很低k50k50k50的比例渐近区误差明显上升。边界判断直接影响后续工具选择。