国际数据挖掘与知识发现大会 ACM SIGKDD（ACM SIGKDD Conference on Knowledge Discovery and Data Mining），简称 KDD，是由美国计算机协会 ACM（The Association for Computing Machinery）的数据挖掘与知识发现专委会 SIGKDD（Special Interest Group on Knowledge Discovery and Data Mining）主办，堪称数据挖掘研究领域的顶级会议。
KDD 最早是从 1989 年开始的 KDD 研讨班（Workshop）发展而来，当时的研讨班依托于人工智能顶级会议 IJCAI 大会或者 AAAI 大会，而后在 1995 年升级成为会议的模式，到现在已经有 20 多年的历史。今年的 KDD 大会于 8 月 13 日至 17 日在加拿大哈利法克斯成功召开。
SIGKDD 每年都会奖励一篇论文，这篇论文要在过去十年间对研究、方法论以及实践产生重大影响，这就是所谓的时间检验奖（Test of Time Award），引用次数以及对一个领域的影响力度是评选这个奖项的重要指标。
2017 年的 KDD 时间检验奖授予了美国康奈尔大学信息科学系主任、计算机科学系教授索斯藤·乔基姆斯（Thorsten Joachims）。这次授予是为了表彰他的论文《线性时间内训练线性支持向量机》（Training Linear SVMs in Linear Time），这篇论文也是 2006 年的 KDD 最佳论文，引用数超过 1600 多次。
Thorsten 的学术贡献Thorsten 是一位机器学习界享有盛誉的学者，也是 ACM 和 AAAI 的双料院士，他所有论文的引用数加起来超过了 4 万次。2001 年从德国多特蒙德大学博士毕业后，他正式加入康奈尔大学从事机器学习研究。
获得这个奖项之前，Thorsten 曾多次获得重要奖项，比如 2017 年 ACM WSDM 的最佳论文奖（Best Paper Award）、2016 年 ACM SIGIR 的时间检验奖、2015 年 ACM KDD 的时间检验奖、2009 年 ECML 的最佳论文奖、2009 年 ICML 的 10 年最佳论文奖（Best 10-Year Paper Award）、2006 年 ACM KDD 的最佳论文奖、2005 年 ICML 的最佳论文奖、2005 年 ICML 的优秀学生论文奖、2005 年 ACM KDD 的最佳学生论文奖等。
Thorsten 在机器学习领域一直有着非常特殊的贡献。首先，他在支持向量机（SVM）的应用上做出了诸多努力。比如这次的时间检验奖，就是奖励他如何把支持向量机的训练达到线性复杂度，从而使支持向量机在大规模数据上的应用成为可能。
Thorsten 还致力于把支持向量机的基本算法，也就是仅仅支持分类问题和回归问题的算法，应用到更加复杂的有结构的输出结果上，俗称结构化的支持向量机算法。得益于这项工作，支持向量机可以对信息检索中很多复杂的、非二分的评估指标进行直接优化，如 F1 值（F-score）、平均精度均值（Mean Average Precision），从而让支持向量机的应用变得更加广阔。
在让支持向量机能够顺利应用到信息检索的过程中，Thorsten 还发现了另外一个问题，那就是如何利用搜索引擎的间接用户反馈（Implicit Feedback）来训练排序算法（经常是一个结构化的支持向量机模型）。具体来说，传统的搜索系统和信息检索系统主要是依靠人工标注的训练数据来进行优化和评估。这里所说的人工标注训练数据，主要是指人为地评价目标查询关键字和所对应的网页是否相关。
早期大家发现，虽然搜索引擎可以利用这样的数据来优化排序算法，但是搜索引擎在使用过程中会产生很多用户数据。这些数据可以是用户点击搜索页面结果产生的信息，也可以是其他的信息（比如用户在搜索页面的驻留时间等等）。早期这些信息并没有用于优化搜索引擎。以 Thorsten 为主的一批学者意识到点击信息的重要性，然后开始利用这些数据来训练和评估排序算法。这是 Thorsten 的第二个主要学术贡献。
Thorsten 第三个主要学术贡献，也是他最近几年的学术成功，那就是把因果推论（Causal Inference）和机器学习相结合，从而能够更加无偏差地训练模型。可以说这部分工作开创了一个新领域。
长期以来，如何有效地应用用户产生的交互数据来进行模型训练，都是大规模机器学习特别是工业界机器学习的难点。一方面，工业系统能够产生很多用户数据；另一方面，这些用户数据又受到当前部署系统的影响，一般都有一定的偏差。
因此工业级机器学习系统面临一个长期挑战，那就是，如何能够在评估模型以及训练模型的时候考虑到这样的偏差，从而去除这样的偏差。

公开

同步至部落

取消

完成

0/2000

荧光笔

直线

曲线

笔记

复制

AI

深入了解
翻译
英语
中文简体
中文繁体
法语
德语
日语
韩语
俄语
西班牙语
阿拉伯语
解释
总结

KDD大会时间检验奖是ACM SIGKDD会议的重要奖项，旨在表彰对数据挖掘领域产生重大影响的论文。2017年该奖项授予了康奈尔大学教授索斯藤·乔基姆斯，以表彰他在机器学习领域的卓越贡献。乔基姆斯的研究成果为机器学习领域带来了新的思路和方法，对大规模机器学习和工业界机器学习具有重要意义。他的论文解决了大规模优化支持向量机的问题，特别是线性支持向量机，提出了简单易行的线性支持向量机实现，并对有序回归的问题达到了线性复杂度。该论文的算法简单、高效、易于实现，并且可以扩展到核函数的情况。乔基姆斯的研究为支持向量机在搜索领域的广泛应用开启了新的可能性。他的论文在实验中验证了提出算法的有效性，展示了提速近100倍的训练时间，并且没有牺牲算法的准确度。这篇经典论文为支持向量机文献史上的重要贡献，对于机器学习领域的发展具有重要意义。

仅可试看部分内容，如需阅读全部内容，请付费购买文章所属专栏
《AI 技术内参》，新⼈⾸单¥98

立即购买

登录后留言

全部留言(8)

最新
精选

李佳
真是开眼界了，原来大牛是这么读经典论文的，学习的榜样啊！
2017-09-25
1
17
yaolixu
洪老师好,您说:“Thorsten 利用因果推论中的倾向评分（Propensity Scoring）技术以及（Multi-armed Bandit）思想，把这样的方法成功地引入到机器学习中，使得无偏差地训练模型成为可能。 ” 我对这方面的研究感兴趣,查看Thorsten教授的主页, 找到下面这篇论文: T. Joachims, A. Swaminathan, T. Schnabel, Unbiased Learning-to-Rank with Biased Feedback, International Conference on Web Search and Data Mining (WSDM), 2017. 我的问题是, 这方面的研究(使用有偏差的数据,无偏差的训练模型)是否还有更多的参考资料?非常感谢😊
2018-06-18
1
7
ヾ(◍°∇°◍)ﾉﾞ
实时相关的任务，比如实时推荐，实时分类等
2018-01-12

7
Zolynn
收获很多
2017-09-29

5
登高
文章没怎么(ﾟoﾟ;看懂，希望随着学习的深入可以明白
2018-05-13
1
3
求渔
多因子的分类问题的训练和预测，如广告投放的预测，政府选举的预测，千人千面的推荐，舆情的分类等
2019-09-08

1
Crystal
请问打不开拓展阅读，怎么办呀，在电脑上显示连接到 www.cs.cornell.edu 时发生错误。
2020-05-04


谢贵阳Garry
谁能解释一下什么是有序回归？
2019-04-08



收起评论



显示
设置



留言





沉浸
阅读





手机端



快捷键



回顶部