
1. 研究背景地震是典型的低频高影响自然灾害其发生位置、震源深度和震级受板块运动、断层结构及局部应力状态共同影响。全球地震目录记录了事件时间、震中经纬度、深度、震级、台站数量和定位误差等信息是观察长期地震活动格局、检验空间集聚和开展数据科学教学的重要基础。USGS持续监测并报告地震、评估影响与危害Kaggle数据集则把2000—2025年的目录记录汇总为可直接分析的表格。本案例复现Kaggle同类分析中常见的震级分布、年度趋势与全球震中图并进一步加入经纬网格密度、相对能量代理、中国文本归属子样本、目录质量变化、球面坐标聚类和严格时间留出分类。研究重点是从可视化与机器学习角度理解目录结构而不是寻找所谓“地震周期”或给出下一次地震的时间地点。2. 研究意义科学传播意义用统一图表解释震级、深度、频度和能量代理的差异减少把“记录多”简单等同于“灾害风险高”的误读。数据方法意义展示大规模时空目录的清洗、球面坐标变换、缺失审计、聚类选择和不平衡分类评估流程。公共安全意义强调事件危险性、人口暴露和建筑脆弱性是不同层次目录分析只能覆盖风险链条中的部分信息。3. 研究问题与实证路径研究依次回答四个问题全球地震记录在震级、深度和时间上具有什么分布特征震中和强震是否在同一空间带集中中国文本归属样本与全球结构有何差异仅用经纬度、深度和时间变量能在未来年份中多大程度识别M≥5.5事件。实证过程遵循“数据质量—描述统计—空间格局—聚类画像—时间留出模型—边界解释”的顺序。4. 数据来源、覆盖范围与缺失结构压缩包包含单个CSV文件原始字段覆盖time、latitude、longitude、depth、mag、magType、nst、gap、dmin、rms、net、id、updated、place、type、horizontalError、depthError、magError、magNst、status、locationSource和magSource。分析保留原始CSV不变仅在Notebook内派生年份、月份、小时、强震标记、深度带和文本地区。raw pd.read_csv(DATA_PATH, low_memoryFalse) raw[time] pd.to_datetime(raw[time], utcTrue) df raw[raw[type].eq(earthquake)].copy() df[year] df[time].dt.year missing raw.isna().mean().mul(100).sort_values(ascendingFalse) print(df.shape, missing.head(10))原始目录从2000-01-01覆盖到2025-06-24各完整年份事件数在约4,700—9,600之间波动2025年只有上半年记录量不能与完整年份直接比较。缺失主要集中于horizontalError、magError、dmin和nst等质量字段其中前三者缺失超过50%或接近50%。经纬度、深度、震级、时间和地点字段无缺失因此主体可视化较稳定模型为避免大规模插补和年代偏差没有把高缺失误差字段作为核心特征。5. 震级与震源深度的样本结构地震样本平均震级为4.829中位数为4.7分布峰值位于M4.5—5.0附近并向高震级快速衰减。这表明该Kaggle数据并非覆盖全球所有微震而更接近中强地震目录因此不能把年度总数理解为全球地震发生总量。按震源深度划分浅源70km占78.9%中源与深源分别形成较小但重要的子群。浅源地震更接近地表但灾害后果还取决于震级、距离、地质条件与暴露度。6.年度记录量与平均震级annual df.groupby(year).agg( events(id, size), mean_mag(mag, mean)) fig, ax plt.subplots(figsize(9.7, 4.6)) ax.bar(annual.index, annual[events]) ax.twinx().plot(annual.index, annual[mean_mag], colorred) plt.show()7.强震记录的年度波动全期M≥5.5事件共有12,508次M≥6.0共有3,780次M≥7.0共有375次。三条曲线都呈不规则起伏2011年M≥5.5数量达到阶段高位但后续并没有稳定的等间隔峰值。8.全球震中的空间带状格局ordinary df[df[mag] 5.5].sample(50000, random_state42) mapping pd.concat([ordinary, df[df[mag] 5.5]]) plt.scatter(mapping[longitude], mapping[latitude], cmapping[mag], s5, alpha.25, cmapturbo) plt.xlim(-180, 180); plt.ylim(-90, 90) plt.show()震中沿环太平洋俯冲带、东南亚群岛、日本—千岛—阿拉斯加弧、南北美西岸以及地中海—喜马拉雅带高度集中洋中脊也形成连续线状分布。图中普通事件抽样显示、M≥5.5事件全部保留点的颜色和大小共同强调震级因此高震级并不等于点密度最高。空间带状结构与板块边界和断层活动相符说明经纬度对样本内强震识别有信息但位置只能刻画长期背景不能给出下一次地震的具体时间。9.经纬网格密度频度与强震的空间错位10.震级与震源深度的联合关系11.高频地区与强震占比按place字段最后一个逗号后的文本归属统计印度尼西亚、日本、巴布亚新几内亚、菲律宾和汤加等环太平洋地区记录量居前12.月份与UTC小时分布13.相对能量代理与极端地震14. 中国地震样本专题以place字段最后文本等于China筛选得到2,619条记录其中M≥5.5为130条、M≥7.0为6条平均震级4.798深度中位数10.0km。震中在中国西部及周边构造活跃区更密集年度记录量在2008年显著升高可能与汶川地震及余震序列有关。15.目录质量随时间变化16.空间—深度聚类的参数选择lat, lon np.deg2rad(df.latitude), np.deg2rad(df.longitude) X np.c_[np.cos(lat)*np.cos(lon), np.cos(lat)*np.sin(lon), np.sin(lat), np.log1p(df.depth.clip(lower0))] Xz StandardScaler().fit_transform(X) labels KMeans(7, n_init30, random_state42).fit_predict(Xz)17.七类全球空间—深度簇七类在地图上形成连续且大体可解释的地震带美洲簇沿南北美西岸延伸日本—千岛—阿拉斯加簇覆盖西北太平洋东南亚—西太平洋簇集中在印度尼西亚和菲律宾南大洋簇沿洋中脊和南桑威奇群岛展开。西南太平洋被分为浅源与深源两类其中深源簇的深度中位数约166km明显高于其他簇。各簇强震率约5%—9%差异存在但没有形成绝对分界说明构造背景能改变概率结构却不能决定单次事件震级。18.时间留出强震识别实验目标变量定义为M≥5.5。2000—2018年训练2019—2021年验证并选择随机森林F1阈值2022—2025年作为从未参与训练的测试期特征仅含经纬度、深度、年份、月份正余弦和小时正余弦。train, valid, test df.year.le(2018), df.year.between(2019,2021), df.year.ge(2022) rf RandomForestClassifier(n_estimators300, max_depth12, min_samples_leaf20, class_weightbalanced_subsample, random_state42) rf.fit(df.loc[train, features], y[train]) prob rf.predict_proba(df.loc[test, features])[:, 1] print(roc_auc_score(y[test], prob), average_precision_score(y[test], prob))模型/阈值ROC-AUCPR-AUC精确率召回率F1平衡Logistic0.5270.066———随机森林0.6810.1590.1860.3310.23819.模型解释、结论结论一全球地震震中沿板块边界带状集中浅源事件占主导空间与深度是目录结构的核心维度。结论二年度频度、强震占比和相对能量代理彼此不同极端巨震可主导能量但不必对应最高记录量。结论三月份和UTC小时未显示稳定规律目录质量随年代变化任何趋势与周期判断都需保持克制。结论四七类聚类能概括全球构造带差异时间留出随机森林有有限区分力但误报、漏报和事后变量决定其不能用于预警。具体细节见原文完整内容可私创造不易谢谢各位多多点赞收藏