
很多 SAP 项目谈到机器学习时,脑海里仍然会出现一条很传统的技术链路。业务数据存储在 SAP HANA 里,数据工程师把数据抽取出去,Python 程序再通过 pandas、scikit-learn 或 TensorFlow 做训练,模型完成之后部署到另外一套服务,业务应用需要预测时再通过 REST API 调用模型。这套架构当然能够工作,但它隐藏着一个很现实的问题,真正最有价值的企业数据,往往已经集中在 SAP HANA 里面。销售订单、采购订单、库存、设备运行状态、客户行为、财务流水和历史预测数据都在那里。如果为了做机器学习,把几千万甚至几亿行数据复制到数据库之外,整个系统马上会多出数据复制、安全控制、网络吞吐、数据一致性和模型生命周期等一整套新的工程问题。SAP HANA 的思路一直不太一样。它希望把相当一部分机器学习计算移动到数据所在的位置,而不是不断把数据移动到算法所在的位置。这也是理解 SAP HANA Machine Learning 最重要的一条线索。SAP HANA Cloud 当前官方能力体系中,机器学习已经不只是传统意义上的分类、回归和时间序列预测。PAL、APL、AutoML、Python Machine Learning Client、大规模分段预测、自然语言处理、文本向量化、TF-IDF,以及 SAP AI Core 集成已经逐渐连成了一条完整链路。SAP 官方最新的 SAP HANA Cloud Feature Scope Description 仍然把这些能力统一放在 SAP HANA Cloud, SAP HANA Database 的 Machine Learning 能力范围内。理解这套体系,可以从 PAL 和 APL 两个名字开始。