作者:Konstantinos Vandikas,人工智能系统首席研究人员
使用统计方法来估计或预测某种现象未来的行为,在医疗保健、贸易、汽车保险和客户关系管理等许多学科中都是常见的做法。这些方法的目标不一定是预测确切的结果,而是确定不同结果的可能性,因为在这种情况下,人们可以做出相应的准备。机器学习进一步增强了此类方法的能力,使它们能够通过使用更多数据和额外计算而变得更加准确。
尽管如此,由于以下三个主要原因,在不同情况下访问此类数据可能会出现问题:
数量:传输此类信息可能非常昂贵,因为这可能会增加网络资源的负担。 隐私:收集的信息可能是敏感的隐私信息;任何有权访问此类数据的进程都会暴露出属于该数据的特定详细信息给不同的个人。 立法:在某些国家/地区,出于法律原因,有关该国选民的数据不得转移到国外。预测模型需要大量数据,这可能会产生问题,因为存储此类数据的成本很高,而且传输此类数据会给网络带来巨大的负载。
如果有一种方法可以训练预测模型,而无需以原始形式传输所需数据,结果会怎样?
为了应对这一挑战,我们与瑞典乌普萨拉大学合作,开设计算机科学项目课程,该课程是其课程的一部分。学生项目是我们研究工作的常规组成部分,这使我们能够探索特定的技术领域,同时也培养与学术界的重要关系。
空气质量预测
今年,我们决定将目光投向空气质量预测。显然,恶劣的空气质量对e 对人们健康的影响。如果我们能够预测空气质量,我们就可以在不同层面上调整我们的行为,从个人行为到社区、国家甚至全球。北京就是一个例子,由于空气质量不佳,煤厂纷纷停产。
预测空气质量是一个具有挑战性的问题,因为从安静的住宅区和公园到繁忙的街道和工业区,不同地方的空气质量可能存在很大差异。我们还需要考虑降雨、气压、温度等大气模式,这些模式会影响空气中每种污染物的含量。收集到的数据不仅可以用于研究空气质量;我们可以寻求预测方法,帮助我们主动确定可以采取的不同措施,以改善空气质量和/或保护敏感群体免受其影响。
测试预测模型
该项目的目标是从使用集中数据——来自多个空气质量监测站的大量数据。这是训练有监督机器学习模型的常用方法,但它需要大量原始数据的传输和聚合。
相反,学生们研究了联合学习,该学习能够在每个站点训练机器学习模型,然后使用联合平均来组合这些模型。
我们的文章“低网络占用的隐私感知机器学习”描述了电信领域联合学习的优势。由于仅传输预测模型的参数,因此可以减少网络中的流量。
在该项目的范围内,我们设想了一个由多个空气质量站组成的分散设置,其中每个站将收集特定区域的数据,并具有计算能力,使其能够使用本地收集的数据来训练预测模型泰德数据并与其他空气质量站进行通信。
由于这样的设置尚不存在,学生们通过研究瑞典气象水文研究所 (SMHI) 收集的测量数据来模拟它。尽管这是一个集中式数据集,学生们还是将其划分为每个气象站(斯德哥尔摩 E4/E20 Lilla Essingen、斯德哥尔摩 Sveavägen 59、斯德哥尔摩 Hornsgatan 108 和斯德哥尔摩 Torkel Knutssonsgatan),并训练了四个单独的模型,这些模型随后通过联合平均进行聚合。
验证结果始终需要比较基线。在这种情况下,开发了一个高性能的集中式模型来针对联合模型进行验证。每个学生都使用相同的训练/测试/验证数据集,但以不同的方式探索它,使用不同的特征和不同的机器学习模型架构。并行测试此类模型并根据其准确性对其进行评估 – 对称平均绝对百分比误差(确切地说,SMAPE)和平均绝对误差(MAE)使学生能够覆盖大面积的不同设置并收敛到高性能的集中模型。
结果
10 个输入特征被用作学生训练的机器学习模型的输入:
实施了不同的模型,包括长短期记忆网络 (LSTM) 和深度神经网络 (DNN) 来预测未来 1、6 和 24 小时。
在集中的情况下,旨在预测下一小时的模型平均表现优于旨在预测第二天的模型。 SMAPE 得分为 0.282 至 0.5214,MAE 得分为 0.22 至 0.47。
在联邦模型方面,观察到了类似的 MAE 分数,这表明我们最初设想的去中心化设置可以得到联邦学习等去中心化训练技术的支持。
如果您想深入了解细节,请查看两个项目组的项目报告。你c您可以在我们的去中心化空气质量监测和预测 GitHub 上找到有关实施的所有信息。
四舍五入
爱立信研究中心和乌普萨拉大学在计算机科学项目课程范围内有着悠久的合作历史,这基本上是我们行业向一群勇敢的学生提出具有挑战性的问题的地方。在此前提下,我们的指导与大学的监督相结合,使学生能够自我组织并应对这一挑战。这通常需要采用 SCRUM 工作方式,投入大量精力开发工作原型,在社交活动中发泄一些情绪,最后共享代码库和项目报告,以便将这项工作提供给其他人。
但今年有所不同。由于 COVID-19 大流行,整个课程需要远程处理。这提出了一个有趣的挑战,因为学生们没有处于同一个环境中。并享受在这个任务中并肩工作并在使用白板时互相了解。相反,他们需要远程完成所有事情,包括社交活动。为了有效地解决这个问题,助教举办了一场小型竞赛——迷你版的 Kaggle,学生们可以在调整预测模型时尝试不同的超级测量仪来进行竞争。
为了创造一个更可持续的地球,很高兴看到联邦学习等技术如何做出贡献,不仅可以简化和改进机器学习模型的训练过程及其整体生命周期管理,而且还可以通过空气质量预测来改善人们的生活质量。我们预计联邦学习和其他技术的更多应用将有助于实现这一目标。
了解更多
阅读第 1 组的项目报告
阅读第 2 组的项目报告
了解实施详情我们的去中心化空气质量监测和预测 GitHub 上的说明。
探索包括人工智能在内的 ICT 如何帮助开创可持续的未来。
人工智能和机器学习 爱立信 纳斯达克股票代码:埃里克
发表评论 文明上网理性发言,请遵守国家相关法律
评论列表