我们在第一眼看到一个人的时候,就会下意识的对这个人产生所谓的第一印象,有些人“看起来”值得信任,有些人“看起来”非常聪明,甚至有些人“看起来”不善交际。为什么我们会仅凭一个人的外表产生这些第一印象?
宋蔓是毕业于加州大学圣地亚哥分校的博士,她的研究方向是认知科学和机器学习。
这一期节目,她将和我们聊聊她如何用机器学习模型理解第一印象的产生。
了解更多,请访问宋蔓的 Google Scholar 页面 (https://scholar.google.com/citations?hl=en&user=vqUdgL4AAAAJ)。
Find out more at http://detasai.com (http://detasai.com)
19 Jan 2021
S2E1 - 用数据科学抗击新冠疫情
用数据科学抗击新冠疫情
这期节目邀请到了在MIT读运筹学博士的李凌志同学,来和我们聊一下他在新冠疫情时做的传染病数学建模的工作。他们的模型后来被美国疾病控制与预防中心(CDC)和所用, 也被刊登到了纽约时报的头条。我们讨论了用数学建模预测疾病传播的方法和挑战 —— 如何用有限的数据做出有意义的模型?怎么量化模型的好坏?在疫情实时发展的情况下,模型是怎么被优化和改进的?李凌志也和我们分享了一些和医生、医院、决策者合作的故事。
想要了解更多,请移步李凌志的公众号文章:
在麻省理工抗击新冠疫情实记 (1): https://mp.weixin.qq.com/s/brJPYDhl78kaZtKpppQ8qA (https://mp.weixin.qq.com/s/brJPYDhl78kaZtKpppQ8qA)
在麻省理工抗击新冠疫情实记 (2): https://mp.weixin.qq.com/s/feLTugkq_g69ygnm-1jf9w (https://mp.weixin.qq.com/s/feLTugkq_g69ygnm-1jf9w)
Find out more at http://detasai.com (http://detasai.com)
iPhone X 发布后网上出现了很多试图“欺骗”它的面部解锁系统的视频,例如人们发现戴眼镜仍然是可以解锁手机的,但是闭上双眼就不能解锁了。在这个使用场景中,如果面部解锁软件被欺骗而不能认出手机的主人听起来不算是什么大新闻,但如果我们能找到一种方法可以让面部解锁将我们误认成手机的主人,听起来就有点让人紧张了。
这一期节目的内容再一次和针对机器学习算法的攻击有关(我们在差分隐私这一期节目中聊到了另一类攻击方式)。在这一类被称为测试时对抗样本的攻击方式中,我们认识到攻击者可能可以用特别的方式给一张本可以正确识别的图片增加噪声,从而让机器学习算法误认为这个图片是其他物件。增加的噪声如此之小,以至于在任何人类看来图片并没有产生任何变化。例如在 MIT 最近发表的这项研究 (http://www.labsix.org/physical-objects-that-fool-neural-nets/)中,研究者用 3D 打印技术制作了一个乌龟。但由于乌龟身上特别的花纹,图像识别算法会坚持认为这只乌龟是一把来福枪。
如何找到可以骗过机器学习模型的对抗样本其实并不那么复杂。但是如何防范这一类攻击难度却非常大。聊到最后,我们的结尾甚至有一点点悲观。
本期嘉宾:宋爽(UCSD 博士候选人)
话题:差分隐私
在淘宝购物、在豆瓣网上打一个分数的同时,我们也无条件地把自己的大量隐私信息交给了不同的网站、商家,因为我们知道自己的信息会相对安全,即使公布也会做匿名化处理。然而我们拱手交给互联网的信息真的那么安全吗?2006年,Netflix 举办的机器学习竞赛所用的数据集中的隐私泄露让我们意识到隐私保护远远比简单的匿名化复杂的多。尽管 Netflix 把数据集中的用户ID和识别码等的识别用户的信息都抹去了,两位研究者通过挖掘一些包含用户信息的电影浏览记录,把这些记录和 Netflix 数据集里的浏览记录进行匹配,反向识别出了在 Netflix 数据集中的个体对应的是哪些人,从而获得了这些用户的其他信息。在这期节目中,我们来讨论在数据收集、公布、使用的过程中,有哪些方法可以减少用户隐私的泄露。其中,宋爽主要介绍了近几年的主流方法,差分隐私(Differential Privacy)。
提到的一些内容
Differential Privacy 这个概念是由 C Dwork, F McSherry, K Nissim and A Smith (http://people.csail.mit.edu/asmith/PS/sensitivity-tcc-final.pdf) 等人在2006年提出的。
宋爽提到了早期的保护隐私的方法 k-anonymity (https://en.wikipedia.org/wiki/K-anonymity),通过降低数据的精度,使得数据集中的每条记录不可识别。
基于 Stochastic Gradient Descent (SGD) 可以满足 differential privacy,并且很多深度学习模型可以用 SGD 来训练,Ian Goodfellow 等人将差分隐私进一步引入了深度学习。具体文章可见
M Abadi, A Chu, I Goodfellow, H. B McMahan, I Mironov, K Talwar, L Zhang(2016) (https://arxiv.org/abs/1607.00133)。
在 Boosting 的那期节目中,张家鹏也和我们分享了 Boosting 在差分隐私上的应用,具体的工作可以参见 C Dwork, G.N Rothblum and S Vadhan(2010) (https://guyrothblum.files.wordpress.com/2014/11/drv10.pdf)。
苹果在官方网站上特意提到他们使用差分隐私技术保护用户数据安全,参见
保护隐私的措施 (https://www.apple.com/cn/privacy/approach-to-privacy/)
Pod Engine is an independent podcast discovery and analytics service and is not affiliated with or endorsed by this podcast. Artwork and show content belong to their owners. Full legal notice.
Explore this show Podcast research with Pod Engine