5.3 向量维度的选择不是越大越好高维向量确实能表达更丰富的语义信息但维度越高索引的内存开销越大距离计算越慢维度诅咒也会导致向量之间的距离区分度下降。实测数据向量维度100 万条 IVF_SQ8 内存P99 延迟nprobe16Recall10128 维~131 MB~15ms93.2%256 维~259 MB~28ms91.8%512 维~515 MB~52ms89.5%768 维~771 MB~78ms87.3%1024 维~1027 MB~105ms85.6%可以看到从 128 维到 1024 维内存线性增长延迟线性增长但召回率反而在下降。这是因为维度越高向量空间中所有点之间的距离趋于均匀区分度下降。建议在选择 Embedding 模型时不要盲目追求高维度。如果 128 维的模型在你的业务上 Recall 够用就不要用 768 维的模型。维度的选择应该在表达能力和检索效率之间找到平衡点。六、总结与选型速查表最后我把全文的核心结论浓缩成一张速查表方便你在实际项目中快速决策场景数据规模过滤率推荐索引量化方式关键参数RAG 知识库百万-千万85%HNSW / IVF_SQ8SQ8 Refineref128 / nprobe16RAG 知识库高过滤百万-千万85%IVF_SQ8SQ8 Refinernlist2048, nprobe16以图搜图千万级无/极低HNSW无压缩M16, ef256以图搜图亿级亿级无/极低DiskANNPQ RefinerSSD IOPS 50万推荐系统召回亿级中等IVF_PQ / SCANNPQnlist4096, nprobe32多模态混合检索百万-千万中等多 Collection 各自建索引按模态选择Hybrid Search RRF超大规模精确检索任意98%FLAT暴力搜索无配合 GPU 加速最后的最后三句话总结索引选型的本质是在内存、延迟、召回率三者之间做 trade-off没有银弹只有适合你业务的选择。参数调优不要靠猜建评测集、画 Recall-Latency 曲线、找拐点这是最科学的方法。生产环境最大的变量不是数据量而是过滤条件的变化。设计架构时一定要为过滤留余量。