2018年8月4日星期六

iPhone垃圾信息被骂惨了,苹果一拍脑门:上机器学习呀

郭一璞 发自 凹非寺 量子位 报道 | 公众号 QbitAI

苹果的市值前不久刚刚破了万亿美元,但是最近,iPhone上的垃圾信息却遭到了一大波国内用户的吐槽:

iMessage被各种黄、赌、骗信息轮番轰炸,甚至愈演愈烈,令人不堪其扰。无奈的苹果公司回应,要用机器学习好好惩治一下这些垃圾信息。

事情的最初,是不少国内媒体发现了这个问题:

什么赌场广告、色情信息、开假发票、卖假货的,各种三教九流违法活动的广告都有。不少用户对此很崩溃:

"天天都让我去澳门赌博,显得我很社会的样子。""我知道我是下一代赌王,可是我想隐退,能不能不要逼我出山,黑名单都十几个了。""现在不仅是色情和赌博了,卖a货的,卖股票的都纷纷效仿,已经成为了灰色产业的宠儿""把iMessage关了都有,还不只信息,每天都有好几个骚扰电话打进来。"

"苹果推信"地下产业

为什么会有这么多垃圾信息?全依赖一种叫做"苹果推信"的地下产业。

简单查询一下即可发现,"苹果推信"和我们平常收到的淘宝店双十一促销短信不同,是绕过移动、联通等电信运营商,通过苹果iMessage渠道,直接发送到苹果用户的设备上。

而"苹果推信"服务的客户,大多数不是什么正经商家,不少经营"苹果推信"业务的网站上都专门强调了可以推广微商、假货、假发票等不法业务。

而苹果用户相对较高的消费水平则更容易被这些暴利不法从业者盯上,于是这样的非法信息就通过iMessage不断发送到用户的手机上。根据AI财经社的信息,此类信息一条只需5分钱。

而非苹果用户手机上收到的营销推广短信,是经过电信运营商的渠道发送到用户手机上的。虽然也有不少营销服务商经营此类业务,但由于电信运营商设定了严格的规则和屏蔽词库,黄、赌、骗类信息会被电信运营商拦截,多数非苹果用户收到的营销短信都是普通的淘宝店打折、APP优惠等信息。

21世纪了,屏蔽垃圾信息都搞不定?

无论是邮件、来电还是短信,活在2018年的我们总觉得,屏蔽这些垃圾信息是一件再容易不过的事情了。毕竟,邮箱自动拦截垃圾邮件、各类手机助手屏蔽骚扰电话,这些功能早在数年前就已经十分成熟了。

而端到端加密的iMessage,并不像普通短信那样经过运营商把关,而是绕开电信运营商,通过移动互联网流量传输。出于隐私保护的原则,苹果或第三方监管机构都不会开放审查接口,所以,在iMessage信息的传输过程中,没有人可以对这些信息进行审查和拦截。

而iMessage的举报功能也略显得鸡肋了。由于注册Apple ID无需身份验证,当一个用户账号因为被多次举报而封停,或是被用户拉黑后,垃圾信息服务商可以换新的账号继续发送垃圾信息。

不堪其扰,用户怎么办?

面对每天数条垃圾信息,用户也不是没有办法。苹果客服给出了两条方案:

一,屏蔽陌生人消息,但可能会漏掉重要信息;

二,关闭iMessage服务。

可惜,两种方法都不能让用户在正常使用时屏蔽垃圾信息。对苹果来说,似乎拦截才是治本的靠谱方法。

还是用机器学习吧

苹果最终还是选择了机器学习。

8月2日,中新网获得了苹果对垃圾信息问题的回应。苹果官方表示,它们正在探索更多的办法以进一步减少垃圾信息,包括采用更先进的机器学习模型识别垃圾信息,以及推出更多的工具来查封这些发送非法信息的账号。

不过,在新的机器学习模型部署之前,苹果用户可能不得不求助于国内各类手机安全软件开发商了。苹果在这份回应中表示,它们在iOS 11中推出了SMS Fraud Extension功能,用户可以使用各种手机助手、手机管家类第三方APP监测垃圾信息,并将它们移送到专属的文件夹里。

不知道作为苹果用户的你,是否买账呢?

欢迎大家关注我们的专栏:量子位 - 知乎专栏

诚挚招聘

量子位正在招募编辑/记者,工作地点在北京中关村。期待有才气、有热情的同学加入我们!相关细节,请在量子位公众号(QbitAI)对话界面,回复"招聘"两个字。

量子位 QbitAI· 头条号签约作者

վ'ᴗ' ի 追踪AI技术和产品新动态



via 量子位 - 知乎专栏 https://ift.tt/2Ktqy86
RSS Feed

RSS5

IFTTT

iPhone垃圾信息被骂惨了,苹果一拍脑门:上机器学习呀

郭一璞 发自 凹非寺 量子位 报道 | 公众号 QbitAI

苹果的市值前不久刚刚破了万亿美元,但是最近,iPhone上的垃圾信息却遭到了一大波国内用户的吐槽:

iMessage被各种黄、赌、骗信息轮番轰炸,甚至愈演愈烈,令人不堪其扰。无奈的苹果公司回应,要用机器学习好好惩治一下这些垃圾信息。

事情的最初,是不少国内媒体发现了这个问题:

什么赌场广告、色情信息、开假发票、卖假货的,各种三教九流违法活动的广告都有。不少用户对此很崩溃:

"天天都让我去澳门赌博,显得我很社会的样子。""我知道我是下一代赌王,可是我想隐退,能不能不要逼我出山,黑名单都十几个了。""现在不仅是色情和赌博了,卖a货的,卖股票的都纷纷效仿,已经成为了灰色产业的宠儿""把iMessage关了都有,还不只信息,每天都有好几个骚扰电话打进来。"

"苹果推信"地下产业

为什么会有这么多垃圾信息?全依赖一种叫做"苹果推信"的地下产业。

简单查询一下即可发现,"苹果推信"和我们平常收到的淘宝店双十一促销短信不同,是绕过移动、联通等电信运营商,通过苹果iMessage渠道,直接发送到苹果用户的设备上。

而"苹果推信"服务的客户,大多数不是什么正经商家,不少经营"苹果推信"业务的网站上都专门强调了可以推广微商、假货、假发票等不法业务。

而苹果用户相对较高的消费水平则更容易被这些暴利不法从业者盯上,于是这样的非法信息就通过iMessage不断发送到用户的手机上。根据AI财经社的信息,此类信息一条只需5分钱。

而非苹果用户手机上收到的营销推广短信,是经过电信运营商的渠道发送到用户手机上的。虽然也有不少营销服务商经营此类业务,但由于电信运营商设定了严格的规则和屏蔽词库,黄、赌、骗类信息会被电信运营商拦截,多数非苹果用户收到的营销短信都是普通的淘宝店打折、APP优惠等信息。

21世纪了,屏蔽垃圾信息都搞不定?

无论是邮件、来电还是短信,活在2018年的我们总觉得,屏蔽这些垃圾信息是一件再容易不过的事情了。毕竟,邮箱自动拦截垃圾邮件、各类手机助手屏蔽骚扰电话,这些功能早在数年前就已经十分成熟了。

而端到端加密的iMessage,并不像普通短信那样经过运营商把关,而是绕开电信运营商,通过移动互联网流量传输。出于隐私保护的原则,苹果或第三方监管机构都不会开放审查接口,所以,在iMessage信息的传输过程中,没有人可以对这些信息进行审查和拦截。

而iMessage的举报功能也略显得鸡肋了。由于注册Apple ID无需身份验证,当一个用户账号因为被多次举报而封停,或是被用户拉黑后,垃圾信息服务商可以换新的账号继续发送垃圾信息。

不堪其扰,用户怎么办?

面对每天数条垃圾信息,用户也不是没有办法。苹果客服给出了两条方案:

一,屏蔽陌生人消息,但可能会漏掉重要信息;

二,关闭iMessage服务。

可惜,两种方法都不能让用户在正常使用时屏蔽垃圾信息。对苹果来说,似乎拦截才是治本的靠谱方法。

还是用机器学习吧

苹果最终还是选择了机器学习。

8月2日,中新网获得了苹果对垃圾信息问题的回应。苹果官方表示,它们正在探索更多的办法以进一步减少垃圾信息,包括采用更先进的机器学习模型识别垃圾信息,以及推出更多的工具来查封这些发送非法信息的账号。

不过,在新的机器学习模型部署之前,苹果用户可能不得不求助于国内各类手机安全软件开发商了。苹果在这份回应中表示,它们在iOS 11中推出了SMS Fraud Extension功能,用户可以使用各种手机助手、手机管家类第三方APP监测垃圾信息,并将它们移送到专属的文件夹里。

不知道作为苹果用户的你,是否买账呢?

欢迎大家关注我们的专栏:量子位 - 知乎专栏

诚挚招聘

量子位正在招募编辑/记者,工作地点在北京中关村。期待有才气、有热情的同学加入我们!相关细节,请在量子位公众号(QbitAI)对话界面,回复"招聘"两个字。

量子位 QbitAI· 头条号签约作者

վ'ᴗ' ի 追踪AI技术和产品新动态



via 量子位 - 知乎专栏 https://ift.tt/2Ktqy86
RSS Feed

RSS5

IFTTT

我们该如何学习机器学习中的数学

数学在机器学习中非常重要,不论是在算法上理解模型代码,还是在工程上构建系统,数学都必不可少。通常离开学校后很难有机会静下心学习数学知识,因此我们最好能通过阅读小组或读书会等形式营造环境,并专注学习那些在实践中常常需要用到的数学知识。

数学达到什么水平才可以开始机器学习?人们并不清楚,尤其是那些在校期间没有研究过数学或统计学的人。

本文的写作目的是介绍构建机器学习产品或进行相关学术研究所必需的数学背景,以及数学在工程和研究中的重要性。这些建议是根据我和机器学习工程师、研究者和教育者交流而得到的,当然也有我自己在机器学习研究和业界工作中的个人经验。

为了构建必备的数学背景,我首先提出不同的思维模式和策略,帮助大家在学校之外也可以接受数学教育。然后,我会给出不同种类机器学习工作所需的数学背景,从高中水平的统计学和微积分到概率图模型(PGM)的最新进展。希望大家读完本文后,能够对自己在机器学习工作中所需要的数学教育有清楚的认知。

关于数学焦虑

很多人害怕数学,包括工程师。首先,我想解决「擅长数学」这一迷思。

一般精通数学的人有大量和数学有关的实践经验。因此,他们在研究数学时更容易保持专注。相比内在能力,学生的思维模式才是决定一个人学习数学能力的关键。

不过要想达到这种状态需要付出大量时间和努力,但是这并不会让你感到无聊。下文将帮助大家确定你所需要的数学水平,以及学习策略。

机器学习中的数学

作为软件工程的开发者,我们一般有基础的线性代数与矩阵微分学知识,也有一些概率论和编程的基础。因此以它们为基础,我们只需要根据不同的方向与领域调整知识结构就行。

那么我们该如何在校外学习数学呢?我相信学习数学最好的方法是将其作为一份全职工作,也就是学生。因为离开了学校,我们很难进行结构化的学习,也很难有正向的同龄压力和众多的学习资源。但是在校外学习中,我比较推荐成立学习小组或研讨会,它们同样能提供类似学校的学习环境。

在研究实验室中,这种课外学习可能是以阅读小组的形式进行。我们可以讨论课本中难以理解的地方,也可以讨论自己对它们的见解。而学习的环境是支持长期数学学习的动力,因此建立这种环境并意识到数学在工程与研究中的重要性非常关键。

数学与代码

数学和代码在机器学习工作流程中高度交织在一起。代码通常可以根据数学直观地构建,它甚至会共享数学符号与句法。实际上,NumPy 等现代数据科学框架令数学运算很容易转化为直观的代码。我们可以将代码作为巩固学习的方式,且数学和代码都依赖于对概念的精确理解与符号表示。例如,手动用 NumPy 实现损失函数或最优化算法是理解它们概念非常好的方式。

作为通过代码学习数学的案例,我们可以考虑一个实际的案例,即为神经网络实现反向传播和 ReLU 激活函数。作为入门级概念,反向传播是一种依赖于微积分链式求导法则的技术,它能高效计算梯度。为了在神经网络中利用链式求导法则,我们可以使用 ReLU 激活函数的梯度乘以上游导数。

为了完成反向传播的案例,首先我们可以可视化 ReLU 激活函数

为了计算 ReLU 的梯度或斜率,我们可以将其可视化为分段函数,其中自变量小于零的地方斜率为 0,自变量大于零的地方斜率恒等于 1。

NumPy 可以帮助我们构建 ReLU 函数,使用 maximum 函数可以只输出该函数中所有参数中相对较大的值。如下所示 x 为输入,relu 为输出:

relu = np.maximum(x, 0)

ReLU 激活函数的梯度值可以表示为以下,其中 grad 表示为上游梯度:

grad[x < 0] = 0

如果没有首先手动推导出梯度,上述代码可能并不是那么容易理解。在我们的代码中,其将所有满足条件 [x < 0] 的元素梯度 grad 都设置为零,也就是说上游梯度只有在 x>0 的情况下才能继续向前传播。在数学上,这等价于 ReLU 激活函数梯度的分段线性表征,它将所有小于 0 的值压缩为 0,并乘上上游梯度。

如上所示,若对于微积分有一定的理解,那么我们可以清晰地理解这两行基本代码。因为机器学习中很多代码都在描述数学运算,因此了解数学原理对于理解机器学习模型过程非常重要。

构建机器学习产品中的数学

为了完成这一章节,我曾与机器学习工程师探讨到底哪些数学对于调试他们的系统最重要。以下一些问题与回答是工程师站在数学的角度下的看法。


  • 我们可以使用什么样的降维算法可视化高维用户数据?

  • 方法:主成分分析与 t 分布随机近邻嵌入


  • 我们该怎样校准阈值(例如置信度选择 0.9 或 0.8)以阻止一些欺骗性的用户数据?

  • 方法:概率校准


  • 将卫星数据偏向硅谷或阿拉斯加等世界某块具体地区的最好方法是什么?

  • 方法:开放性问题,也许可以是人口统计学方法


一般而言,统计学和线性代数能以某些方式应用于这些问题。然而,为了获得令人满意的回答,我们通常需要特定领域的方法。如果是这样的话,我们该如何选择一些我们需要学习的数学内容?

定义你的系统

目前有非常多的资源可以帮助我们跨越写代码而直接调用函数构建机器学习系统,例如数据分析中常用的 scikit-learn 和深度学习中常用的 keras。所以你们可以尝试回答以下关于搭建机器学习流程的问题:

  1. 机器学习系统中输入和输出都是什么?

  2. 我们该如何准备合适的数据以拟合系统?

  3. 如何构建特征或数据以帮助模型提高泛化性能?

  4. 如何为我们的任务定义合适的目标函数

你可能会比较惊讶,定义机器学习系统可能会比较困难,但搭建的流程并不复杂。换而言之,构建机器学习产品要求非常多的工程工作,但并不要求有非常深厚的数学背景。

资源:谷歌机器学习应用的四十三条经验法则(附 PDF)

学习必要的数学

如果一头钻进机器学习工作流,你可能会发现在调试机器学习系统时会遇到一些困难。当遇到困难时你知道需要查找什么吗?你的权重是不是合理?为什么模型使用一些损失函数不能收敛?用什么样的度量方法衡量模型性能才是合理的?在这个时候,对数据分布做出假设、约束最优化方法或采用不同的算法都是非常有帮助的。

通常,你可能会发现在建模和调试过程背后有直观的数学原理,例如选择损失函数或评估度量,这些数学原理都会帮助我们实现更优的工程决策。

因此,根据实际工程中遇到的数学,再进一步学习这些数学才是更好的方法。

机器学习研究中的数学

这里,我想要描述下对机器学习研究有帮助的数学心态。对机器学习研究比较嘲讽的观点认为,它是一种即插即用的系统,把大量计算层级堆叠在一起而获得好的表现。在一些圈子里,研究人员依然质疑经验性的方法缺乏严谨的数学推导(例如,一些深度学习方法),无法为我们带来广义上的智能。

它担忧研究界可能是建立在已有的系统与假设上,并未扩展我们对机器学习领域的基础理解。研究员们需要贡献新的、基础的研究模块,从而用于启发全新的洞见与研究方法。例如像深度学习先驱 Geoff Hinton 提出 Capsule 网络一样,它重新考虑图像分类中常用的 CNN 基础。

为了机器学习的下一步跃迁,我们需要提出基础问题。这需要对数学的熟练掌握,就像深度学习书籍的作者 Michael Nielsen 描述的「有趣的多探索」。这个过程可能经历数千小时的思考、提问、推翻问题寻求新的视角。「有趣的探索」能让科学家提出深度、有洞见的问题,超越简单的想法和架构。

要清楚,在机器学习研究中,不可能什么都学。为了正确地「有趣探索」,需要你遵照自己的兴趣,而不是一直计较最热的新研究。

机器学习是一个异常丰富的研究领域,有大量未解决的问题:公正、可解释性、易用性。如同所有的学科一样,基本思想不是请求式的过程,需要耐心地用高级数学框架思考重大难题的解决方案。

民主化机器学习研究

我希望我没有把「研究数学」描述得过于难懂,因为使用数学的思路应该以直观的方式表现。悲哀的是,许多机器学习论文仍然充满大量复杂的、前后矛盾的术语,关键直觉难以理解。作为学生,你可以为自己、为这个领域做个伟大贡献:通过博客、推特等方式把这些密集的论文转写为可消化的直觉知识块。以 distill.pub 为例,它就专注于提供对机器学习研究的清晰解释。换言之,把技术思路的解释作为学习探索的方式,有趣而又有帮助。

总结

希望本文能够帮助大家针对机器学习提高数学水平。

  • 不同的问题要求不同的数学水平,我鼓励大家首先理清自己的目标。

  • 如果你希望构建产品,那么寻求同伴和研究小组,通过向最终目标的前进而激励自己学习。

  • 在学界研究中,广泛的数学基础可以帮助贡献新的基础构造块,进而推动领域发展。

  • 通常,数学(尤其是研究论文形式的数学)令人望而生畏,但是「沉醉其中」是学习过程的一大部分。

参考链接:https://blog.ycombinator.com/learning-math-for-machine-learning/

]]> 原文: https://ift.tt/2vivN5Q
RSS Feed

机器知心

IFTTT

把酱油瓶放进菜篮子:UC Berkeley提出高度逼真的物体组合网络Compositional GAN

生成对抗网络(GAN)可以产生复杂且逼真到令人惊讶的图像,但它会忽略可能存在于场景中的多个实体间的显式空间交互。本文提出以 GAN 为框架、将目标组合建模为自洽的组合-分解网络。该模型以其边缘分布的目标图像为条件,通过明确学习可能的交互,在联合分布中产生逼真的图像。实验结果表明,训练后的模型可以在作为输入的两个给定的目标域间捕获潜在的交互关系,并以合理的方式在测试时输出组合场景的新的实例。

1. 引言

生成对抗网络(GAN)是在给定输入的条件下生成图像的一种强大方法。输入的格式可以是图像 [9,37,16,2,29,21]、文本短语 [33,24,23,11] 以及类标签布局 [19,20,1]。大多数 GAN 实例的目标是学习一种可以将源分布中的给定样例转换为输出分布中生成的样本的映射。这主要涉及到单个目标的转换(从苹果到橙子、从马到斑马或从标签到图像等),或改变输入图像的样式和纹理(从白天到夜晚等)。但是,这些直接的以输入为中心的转换无法直观体现这样一个事实:自然图像是 3D 视觉世界中交互的多个对象组成的 2D 投影。本文探索了组合在学习函数中所起到的作用,该函数将从边缘分布(如椅子和桌子)采集到的目标不同的图像样本映射到捕获其联合分布的组合样本(桌椅)中。

由于不同对象间在相对缩放、空间布局、遮挡以及视角变换等方面可能存在复杂的交互关系,在自然图像中对组合建模是一个极具挑战的问题。近期的研究在 GAN 框架 [15] 中使用空间变换网络 [10],通过在几何扭曲参数空间中进行操作,找到前景对象的几何纠正来分解该问题。但这种方法仅限于固定的背景,也并未考虑真实世界中更加复杂的交互关系。近期的另一项研究是以文本和场景图为条件生成场景的,这项研究明确地对对象和其交互关系进行了推理。

我们开发的这种方法可以对图像中的目标组合建模。我们将组合两个输入对象图像的任务视为生成一个联合图像,该图像可以捕获这两个对象在自然图像中的联合交互关系。例如,给定椅子和桌子的图像,可以产生一张包含相同的成对桌椅的自然交互的图像。一个可以正确捕捉组合特征的模型需要对遮挡排序(如桌子在椅子前面)和空间布局(如椅子在桌子内滑动)有所了解。据我们所知,我们是第一个在没有任何清晰的关于目标布局的先前显式信息的情况下,在图像条件空间中解决该问题的组。

我们的工作重点是将两个目标组合的问题重构为先组合好给定的目标图像以生成可以对目标交互关系建模的联合图像,再将联合图像分解,以获得单个目标。这样的重构可以通过组合-分解网络加强自洽约束 [37]。但在一些场景中无法用组合合成图像对相同的目标实例的成对样例进行访问,例如,要根据给定桌子和椅子的图像生成联合图像,除了指定的桌子外我们可能没有任何有关指定椅子的样例,但我们可能有其他桌子和椅子的图像。我们在组合分解层添加了修复网络,以处理这样的不配对情况。

通过定性和定量实验,我们在两个训练场景中评估了我们提出的 Compositional-GAN 方法:(a)配对:当我们有权用相关组合图像访问单个对象图像的成对样例时;(b)未配对:当数据集源于联合分布且没有与来自边缘分布的任何一张图进行配对时。

联合 GAN 代码和数据集请参阅:https://github.com/azadis/ CompositionalGAN

论文:Compositional GAN: Learning Conditional Image Composition

论文链接:https://arxiv.org/pdf/1807.07560v1.pdf

生成对抗网络(GAN)可以产生复杂且逼真到令人惊讶的图像,但它一般会从单个潜在源采样建模,从而忽略可能存在于场景中的多个实体间的显式空间交互。在相对缩放、空间布局、遮挡或视角转移等情况下在不同目标间捕获复杂的交互关系是极具挑战的问题。本文提出以 GAN 为框架、将目标组合建模为自洽的组合-分解网络。该模型以其边缘分布的目标图像为条件,通过明确学习可能的交互,在联合分布中产生逼真的图像。我们在对单独的目标进行配对和不配对的两个场景中通过定性实验和用户评估对模型进行了评估,在训练过程中也给出了联合场景。结果表明,训练后的模型可以在作为输入的两个给定的目标域间捕获潜在的交互关系,并以合理的方式在测试时输出组合场景的新的实例。

图 1:组合 GAN 对配对和未配对训练数据训练得到的模型。黄色框指的是用于在给定第二对象被遮挡的情况下合成第一对象的新视角的 RAFN 步骤,该过程仅用于成对数据的训练过程。橙色框表示用未配对数据修复输入分割的过程。对配对和未配对的情况而言模型的剩余部分相似,都包括 STN,再之后是自洽组合-分解网络。

图 2:使用配对或未配对数据训练桌椅组合任务的测试结果。「NN」代表成对训练集中最接近的图像,「NoInpaint」表示在没有修复网络的情况下未配对模型的结果。在配对和未配对情况中,cˆ before 和 cˆ after 分别表示在推理细化网络之前和之后的生成器的结果。cˆ after s 表示细化步骤后的有遮掩的转置输入的总和。

4 实验

图 3:用配对或未配对数据对篮子-瓶子组合任务训练后的测试结果。「NN」表示在配对的训练集中最近的图像,「NoInpaint」表示在没有修复网络的情况下用未配对数据训练得到的模型。在配对和未配对情况中,cˆ before 和 cˆ after 分别表示在推理细化网络之前和之后生成器的输出结果。此外,cˆ after s 表示细化步骤之后遮掩情况下转置输入的总和。

表 1:AMT 用户评估比较我们提出的模型的不同组件。第一列表示在未配对场景中推理(未细化)期间要细化的图像的偏好百分比。第二列表示与未配对情况相比,通过配对数据训练策略生成的细化图像的偏好百分比。

图 4:面部-太阳镜组合任务的测试样例。前两行表示输入的太阳镜图像和面部图像,第三行和第四行分别表示用配对和未配对数据训练的组合 GAN 的输出。最后一行表示 ST-GAN 模型生成的图像。

]]> 原文: https://ift.tt/2KqT6yZ
RSS Feed

机器知心

IFTTT

谷歌云服务计划打入国内市场,正与腾讯、浪潮商谈合作

8 月 3 日,根据彭博社报道,谷歌正在与腾讯、浪潮等国内几家科技巨头展开合作,打算在中国布局自己的云服务。

根据 Synergy 研究团队的调查结果,中国是世界上第二大的云市场。面内如此庞大的市场,各大云服务巨头怎能无动于衷?国外云服务巨头在拓展中国区业务时多会选择与国内公司合作。2014 年,微软与国内服务商世纪互联展开合作,在中国监管环境下运营公有云。2016 年,亚马逊宣布授权国内公司北京光环新网,基于北京及周边地区的基础设施,在中国境内提供并运营北京区域的亚马逊云技术及相关服务,将自己的云服务置于政府的监管之下。现在,谷歌似乎也要走这条竞争对手走过的老路。

据知情人士透露,谷歌正积极与腾讯、浪潮等国内公司展开商谈,目的是通过国内的数据中心和中国企业的服务器来运行谷歌的互联网服务,例如谷歌云盘(Drive)和谷歌文档(Docs),这和其它美国云公司进入中国市场的方式很相似。在中国以外的其它大部分区域,谷歌云在互联网上提供计算资源和存储,并出售一套在其数据中心运行的办公应用——G Suite。但中国要求服务商将数字信息保存在国内,而谷歌在大陆并没有数据中心,因此它需要和本地企业合作。这场商谈始于 2018 年初。今年 3 月下旬,谷歌将候选合作伙伴缩小为三家企业。但鉴于中美之间紧张的贸易局势,该计划是否会进行下去尚不得而知。

谷歌云总裁 Diane Greene 在上周说道,她希望将谷歌云打造成「全球云」,但拒绝透露关于中国业务的具体细节。为拓展云业务,该公司正在招聘上海业务发展经理。相关招聘信息中把「中国市场的丰富经验和知识」列为优先条件。一位谷歌云发言人拒绝对此作出评论。浪潮和腾讯发言人也没有立即回应彭博社的置评请求。

谷歌在中国的云合作伙伴关系将有助于该公司与亚马逊和微软展开更多竞争。与腾讯、浪潮等中国大型科技公司的合作会给谷歌带来强大的盟友,但同时也将面临和本地企业的竞争,包括阿里巴巴,后者的云业务在中国市场占有很大份额。

在此之前,谷歌与腾讯已经展开了云服务相关的合作。腾讯官网显示,该公司运营着自己的云服务,而且正在搭建一个包括思科、英伟达、德勤在内的合作伙伴生态系统。其目前提供的云服务名为「Tencent Kubernetes」引擎,该服务基于一项流行的谷歌同名https://www.bloomberg.com/news/articles/2018-08-03/google-is-said-to-be-in-china-cloud-talks-with-tencent-others技术。

如果这次合作得以实现,谷歌可以在腾讯数据中心运行 Gmail、Drive 和 Docs,腾讯可能建议现有的云用户尝试谷歌的产品。此外,谷歌推出的人工智能应用编码库 Tensorflow 在国内的研究者、软件开发者中越来越受欢迎。虽然该编码库与其他云服务兼容,但它与谷歌的云计算进行协作效率最高。

参考链接:https://ift.tt/2AEuYcr

]]> 原文: https://ift.tt/2KrhkJj
RSS Feed

机器知心

IFTTT

2018谷歌学术期刊&出版物排名公布:CVPR挤进前20

自 2012 年起,谷歌学术(Google Scholar)每年都会发布一次全球学术出版物重要指数排名。近日,谷歌公布了 2018 年的最新排名。随着人工智能的火热,一些 AI 顶会也进入了榜单的前 100 名,其中包括 CVPR(第 20 名)和 NIPS(第 54 名)。

榜单链接:https://scholar.google.com/citations?view_op=top_venues

谷歌学术为读者提供了一个便捷的方法来快速评估学术期刊中最新文章的可读性和影响力。美国时间 8 月 2 日,它发表了 2018 学术期刊&出版物排行榜。该榜单涵盖了 2013-2017 年之间发表的的文章,以及截至 2018 年 7 月底谷歌学术索引中被引用过的所有文章。

该榜单还包括来自网站的期刊文章,这些文章符合谷歌学术的收录指南。此外,随着 AI 科技的发展,一些计算机科学和电子工程方面的会议文章也被收入在内。不过,2013-2017 年间发表文章不到 100 篇,以及这些年未被引用过的出版物没有涵盖在内。

今年的榜单包含了 12 种不同语言的前 100 名出版物信息,以及 8 大领域 260 个子领域的前 20 名出版物信息。

你可以从榜上发现一些特定类别的出版物,如《食品科学与科技》(Food Science & Technology),《可持续能源》(Sustainable Energy),《公共安全》(Public Health),以及一些比较泛泛的出版物,如《工程与计算机科学》(Engineering & Computer Science),或《人文、文学与艺术》(Humanities, Literature & Arts)。对于每种出版物,你可以通过点击 h5 索引来查看其最热门的文章。

榜单上包含大量出版物,远超每一类别和每种语言页面上列出的数量。你可以通过在搜索框中输入出版物标题中的关键词来查找这些出版物,例如,heart、water、saude。

更多细节请戳:https://ift.tt/TnJoTe

「更客观」的排名标准

谷歌学术出版物排名主要参考 3 个参数:

  • h 指数表示,出版物中至少有 h 篇论文被引用至少 h 次。例如,某出版物有 5 篇论文被分别引用 17、9、6、3、2 次,那么该出版物的 h 指数为 3。

  • h 核心表示,出版物中被引用次数最高的 h 篇论文。例如,上述例子中,该出版物的 h 核心为 3,即分别被引用 17、9、6 次的文章。

  • h 中位数表示,h 核心中排在中位数的论文被引用的次数。上述例子中,该出版物的 h 中位数是 9。h 中位数是衡量 h 核心中文章引用分布的一个尺度。

谷歌学术榜单采用的 h5 因子统计方法与传统学术期刊的「影响因子」统计法所得结果不尽相同。h5 因子并不会因为一篇超高被引次数的文献而增长。另外,相对而言,综述论文相比新研究更易得到引用。所以在影响因子为主的排名中,综述类期刊以及综述占比较高的期刊明显占优。h5 因子和 H 中位数的计算方法更关注的是期刊中被引用数较多的那部分论文,这使其对期刊中各种类型文章所占比例不太敏感。

Top100 完整榜单(英文期刊)

在「含金量」最高的总榜单中,排名前三的是 Nature、新英格兰医学杂志与 Science。

中文期刊排名(前 20 名)

工程和计算机科学分类前 20 名

人工智能子领域前 20 名

在谷歌学术的统计中,CVPR 大会被引用次数最多的论文是何恺明、张祥雨、任少卿与孙剑的 CVPR2016 最佳论文《Deep Residual Learning for Image Recognition》,目前被引用次数已经超过了 10000 次。

而在 NIPS 中,被引用次数最多的论文是 2013 年 Tomas Mikolov、Jeff Dean 等人的《Distributed Representations of Words and Phrases and their Compositionality》,被引用次数已经超过 8000 次。

此外,在谷歌学术排名推出之后,谷歌大脑研究员 @hardmaru 第一时间整理出了 Top 100 总榜单中的机器学习/人工智能期刊、会议特别关注列表:

1. Nature

3. Science

20. CVPR

23. PLoS ONE

41. Neuron

44. Nature Neuroscience

54. NIPS

60. Cancer Research

70. Nature Physics

84. Nature Chemistry

88. IEEE Communications Magazine

]]> 原文: https://ift.tt/2ncNmQi
RSS Feed

机器知心

IFTTT

DeepSeek + Pi 王炸组合跑赢 Claude Code?-InfoQ每周精要No.935

「每周精要」 ...