
人机大战还没结束,但“战场”已经变了。还记得当年的 AlphaGo 吗?
2016年,AlphaGo 4:1 击败李世石; 2017年,又在围棋领域战胜柯洁。
当时很多人第一次意识到:原来机器不只是“算得比人快”,还可以学着做决定。
AlphaGo背后的一个重要概念,就是 Reinforcement Learning(强化学习)。
你更应该理解的是:强化学习到底和我们每天接触的数据有什么关系?
传统数据分析:告诉你“发生了什么”
这个月销售额下降了10%。我们会继续分析:哪个产品下降较多? 哪个地区下降较多? 哪个客户群流失较多?
但如果进一步问:“那下一步到底应该怎么做?”问题就开始变复杂了。这时候,强化学习思路就出现了
可以把它简单理解成:不是只估计结果,而是不断尝试“下一步怎么做”,再根据结果调整策略。
比如一个营销活动:
给客户发券? 不发? 换一个力度? 什么时候发? 给谁发?
系统每做一次决策,都可能得到反馈:接受了 → 没接受 → 没有奖励 长期留存提高 → 更大的奖励
慢慢地,它学习的就不只是:“谁更可能买?”而是:“下一步做什么,长期效果可能更好?”
今天你可能在很多商业场景里看到类似的思路:
📌 Marketing 不同客户应该推什么内容、什么时候触达?
📌 Recommendation 用户下一次应该看到什么?
📌 Pricing 不同市场环境下,价格或者营销策略怎么调整?
📌 Risk 面对不断变化的客户行为,下一步应该采取什么策略?
📌 Operations 库存、资源、配送等问题,如何进行动态决策?
因为真正复杂的业务决策,从来不是:“模型算出来一个答案 → 公司直接照做。”
中间还有很多问题:数据从哪里来? 指标到底怎么定义? 什么才算“成功”? 这个结果符合业务逻辑吗? 如果策略改变,应该看短期效果还是长期效果? 实验怎么设计? 结果怎么解释给业务团队?
这些事情,依然非常需要业务理解 + 数据思维。
“人机大战”真正值得讨论的问题,可能已经不是:Who Win?
而是当机器越来越会做决定, 人真正应该负责什么?这可能才是未来几年,数据分析师更值得思考的问题。本周五8月21日多伦多时间8pm五大行数据科学家精彩分享。
