预约成功

使数据科学项目产品化是许多用例的目标。为了提高这一过程的效率,近年来出现了机器学习工程师的新角色。还有一套新的工具来驱动从原型到产品的转换,帮助跟踪与分析产品相关的上下文和元数据。
机器学习在产品中的应用还处于初级阶段,最佳实践才刚刚出现。随着高级分析模型的普及,有几点需要考虑,包括:
1、数据科学挑战有哪些——部署环境
您可能需要与现有的日志或a/B测试基础结构集成。除了将稳定、高性能的模型部署到服务器之外,部署环境还越来越多地包括如何以及何时将模型部署到边缘端(移动设备是一个常见的示例)。已经出现了新的工具和策略来将模型部署到边缘设备。
2、数据科学挑战有哪些——大小、延迟、新鲜度
训练模型需要多少数据、重新训练模型需要多少响应时间以及更新数据集的频率?后者表示您有一个可重复的数据管道。
3、数据科学挑战有哪些——偏见
如果你的培训数据不具有代表性,你会得到不满意(甚至不公平)的结果。在某些情况下,您可以使用倾向分数或其他方法相应地调整数据集。
监控模式:我认为人们低估了监控模式的重要性。在这方面,研究过统计学的人具有竞争优势。很难知道模型什么时候退化了,退化了多少。概念漂移可能是一个因素。对于分类器,一种策略是将模型预测的类别分布与观察到的预测类别分布进行比较。您还可以设置不同于机器学习模型评估指标的业务目标。例如,推荐系统的任务可能是帮助发现“隐藏或长尾”内容。
4、数据科学挑战有哪些——关键应用程序
部署在关键环境中的模型必须比普通消费者应用程序更稳定。此外,此类环境中的机器学习应用程序必须能够“连续”运行数月(无内存泄漏等故障)。
5、数据科学挑战有哪些——隐私和安全
一般来说,如果你能让用户和企业相信他们的数据是安全的,他们可能更愿意共享数据。如前所述,增加额外功能的数据往往会产生更好的结果。对于在欧盟开展业务的企业来说,一个紧迫的问题是《通用数据保护条例》(gdpr)将于2018年5月生效。在其他领域,对抗性机器学习和安全性机器学习(包括处理加密数据的能力)的实践研究已经开始出现。
以上就是《数据科学挑战有哪些?数据分析师敢不敢面对这个挑战》的全部内容,从文字中我们可以看到,使数据科学项目产品化是许多用例的目标。为了提高这一过程的效率,近年来出现了机器学习工程师的新角色,如果你想面对这些挑战,小编建议大家点击下方资料下载链接。