2018年8月2日星期四

如何在计算机上配置数据科学开发环境

从Python、R等编程语言到以Git为例的版本控制系统甚至Unix Shell等命令行工具,数据科学家的武器库现在越来越丰富了,在个人计算机上同时使用这些武器可能会对新入门的数据科学家们造成不小的困扰,本文就将带你学习这些数据科学武器的配置方法。

在Datacamp这样的在线交互培训和教育平台上学习之后,下一步要做的就是使用自己的计算机应用Python,R,Git,或者Unix Shell中的技巧。然而,怎样准确地知道不同的项目需要什么样的准备工作呢?本教程就将帮助你了解需要安装哪些插件和软件,它包括:

  • Anaconda   Python的优势及其在操作系统中的安装。

  • 同时使用R和RStudio的好处及其在操作系统中的安装。

  • Unix Shell的优势及其使用方法。

  • Git的优势及其在操作系统中的安装。

接下来,让我们开始学习吧!

Python

为了使用Python,首先你需要在电脑中安装它。网络上有许多不同版本的python,但是对于数据科学来说,Anaconda Python发行版是使用最广泛的。

Anaconda的优点

Anaconda是一个包管理器,也是一个环境管理器,更是一个包含许多开放源码包的集合的Python发行版。Anaconda的安装附带了许多软件包,如numpy、scikit-learning、scipy以及pandas,这也是安装Jupyter Notebooks的推荐方法。

Jupyter Notebooks

https://ift.tt/2lcpcab

下图显示了一个正在运行的Jupyter Notebooks。Jupyter Notebooks既包含代码,也包含丰富的文本元素,如图表、链接和方程式。

更多Jupyter Notebooks知识:

https://ift.tt/2fpjFKq

使用Anaconda的一些其他好处:

  • 如果安装Anaconda后需要额外的软件包,可以使用Anaconda的软件包管理器conda或pip。这是非常便捷的,因为你不必自己管理多个包之间的依赖关系。Conda甚至可以轻松地在Python 2和3之间切换。

  • Anaconda附带了Python的集成开发环境Spyder。集成开发环境(Integrated Development Environment)是一种编码工具,它允许你编写、测试和调试代码,因为它们通常提供代码补全、代码高亮、资源管理和调试工具以及许多其他功能。还可以将Anaconda与其他Python集成开发环境集成在一起,包括PyCharm和Atom。

    更多关于Python集成开发环境的信息https://ift.tt/2sWUoKT

如何安装Anaconda(Python)

下面的链接将教你在操作系统上安装Anaconda。

在Mac上安装:

https://ift.tt/2HlG6Js

在Windows上安装:

https://ift.tt/2jQQ0sW

R语言

大多数使用R编程语言的人也安装了RStudio。RStudio集成开发环境(IDE)通常被认为是使用R 语言最简单、最高效的方法。

RStudio的优点

安装R语言后,你就可以使用R语言提供的功能和项目啦,还可以在R解释器中构建和运行命令。RStudio可提供一个完整的,与R解释器完美融合的开发环境。

打开RStudio时,屏幕如上图所示。四个窗格分别是:(a)一个文本编辑器。(b)一个开发环境的控制面板。(c)R解释器。(d)帮助窗口和包管理系统。这些特性使得它能够成为在你安装R语言之后真正需要的RStudio。新手们经常问的一个问题是如何在R中安装软件包。下面的视频演示了使用RStudio的包管理器安装tidyverse的一个方法。


你可以在Datacamp的两个课程系列中了解更多RStudio的特性。

学习使用RStudio集成开发环境:

第1部分:

https://ift.tt/2ODfWqk

第2部分:

https://ift.tt/2ABRRxb

如何安装R和RStudio

下面是介绍如何在操作系统上安装R和RStudio的一些链接。

在Mac中安装R和RStudio:

https://ift.tt/2eP2umf

在Windows中安装R和RStudio:

https://ift.tt/2kub0a4

Unix Shell

导航目录、复制文件、使用虚拟机等都是数据科学家工作的日常。Unix Shell常被用于完成这些任务。

Unix Shell的一些用法

许多云计算平台都是基于Linux的(利用Unix Shell的特性)。例如,如果您想在Google Cloud上建立一个数据科学环境,或者在使用Jupyter Notebooks进行深度学习,都需要一些Unix Shell知识。有时可能也会需要Windows虚拟机,但它并不常用。

Windows虚拟机:

https://ift.tt/2j2Eoqi

Unix Shell里面有很多有用的指令,比如 wc 指令能够计算文件中的字数和行数、cat指令能够拼接文件、head和tail指令能够把一个大文件分割成许多小文件等等。

在数据分析中八个最有用的Shell指令:https://ift.tt/2CXqDkM

Unix Shell是个有用的工具,在实践中你能经常发现Unix Shell与其他的语言和技术结合使用,在本文中也有很多这样的例子。

你会经常看到Unix Shell和其他的技术结合使用的情况。比如,在Jupyter文档里,你会经常遇到Shell命令行+Phthon代码的组合。在Jupyter文档里如果你想调用Shell命令的话,输入!然后接着写shell语句即可实现相应命令的调用。在下面的代码里,shell命令ls  (这个命令可以列出当前路径下的所有文件)被赋给了python变量myfiles。

myfiles = !ls

下面这张图里的Python代码能够将多个数据集合并到一起。注意在这个Jupyter文档中红框里的部分,它就是一个Unix Shell命令。


请注意,上图中的例子并不是什么特殊用法,我们只是通过它来告诉大家Unix Shell是怎么用的。如果大家意犹未尽还想多学一点Unix和数据科学相关的技术的话,我们强烈推荐Datacamp上的入门课程《Introduction to Shell for Data Science》 ,免费的哦。课程中会教授很多大牛数据科学家都不知道的神奇秘技,在实际工作中还是很有用的,值得一看。

课程链接:

https://ift.tt/2zRc4i2

Mac系统中Unix Shell使用

Mac本来就是基于Unix开发的,所以生来就自带Unix Shell功能。但是Unix系统的衍生版本太多了,系统和系统之间的Unix Shell指令就会稍有差别。有时候你会发现换了个电脑或者换了个系统之后,很多你熟用的指令就用不了了,比如说wget。为了解决这个问题,Mac上面有人做了一个Homebrew软件来对其进行管理,就像R语言的包用RStudio管理、Python的包用Anaconda进行管理一样方便。

如何安装和使用Homebrew:

https://ift.tt/2KPr2pL

Windows系统中的Unix Shell

Windows本身没有Unix Shell功能,但还是能够通过安装一些软件来在Windows中使用Unix Shell。Git on Windows上就有一些可选的Unix工具,安装了之后就能在cmd里愉快的使用Unix Shell了。除此之外,Gnu on Windows和Cygwin(最小100mb)都可以让Windows上运行Unix Shell。

Gnu on Windows

https://ift.tt/t4Uwqs

Git on Windows

https://ift.tt/2ABRUZT

Git

Git是目前最流行的版本控制系统,在各种公司和项目中使用极其频繁。Git能够记录用户对项目的任何修改,所以用户能够回滚项目到之前的任意版本。Git能够帮你更好的进行团队项目的开发,在很多工作场景都能发现Git的身影。学习Git的好处包括:

  • 记性好:只要是Git管理起来的工程就不会丢,什么时候想看看以前的样子都妥妥的

  • 冲突避免:团队合作中,如果你的修改和别人的修改有冲突的话,Git会提示你,而不是无脑覆盖,这样就能够尽量避免合作场景中由于修改冲突而导致的工程覆盖问题

  • 同步妥:Git跨平台能力很好,在什么系统上都能用Git管理项目,所以在一个跨平台多人合作的团队项目中用着特顺手

  • 开源轻松:Git能让R和Python开源包的开发更容易

和其他技术的集成

Git和其他技术也经常能混搭使用。之前咱们说过RStudio IDE(回顾一下看这里https://support.rstudio.com/hc/en-us/articles/200532077-Version-Control-with-Git-and-SVN),它大概是目前最好用的R语言编程环境,在RStudio里面就有版本控制的功能,而且大多数的Python IDE里也都有版本控制功能。你以为他们会下老本自己开发一个版本控制软件?别傻啦,它们就是把Git集成起来而已,简单粗暴又有效。

RStudio IDE

https://ift.tt/1lllPCg

如果你想学更多的Git在数据科学中的使用方法和技术的话,我们推荐您去看DataCamp上的课程 《Introduction to Git for Data Science》,还是免费的哦。

Introduction to Git for Data Science

https://ift.tt/2kedtI9

安装Git

下面的链接教你怎么安装Git,有Mac和Windows版本:

在苹果系统上安装Git

https://ift.tt/2vjnPtl

Install Git on Windows

在Windows系统上安装Git:

https://ift.tt/2AxB9z4

这作者怎么也不提供个Linux的,看不起我们嘛!烫烫烫烫烫,难过让我溢出,所以为什么是VS的溢出,算了算了……

总结

本教程主要讲了怎么在自己的计算机中搭建数据科学环境。值得注意的是,文中的技术通常是搭配出现的。如果对这个教程有任何问题的话,可以在作者的Twitter中留言询问。当然了,也欢迎随时查看作者的Github或者Medium博客来查看其他的安装教程。

作者的Twitter

https://twitter.com/GalarnykMichael

作者的Github

https://ift.tt/2aCHWco

Medium博客

https://ift.tt/2ABRWRv

]]> 原文: https://ift.tt/2ODgxs4
RSS Feed

机器知心

IFTTT

哈佛研究者推出新型优化算法,指数级提升计算速度

一种新出现的算法可以大大缩短电影推荐和出租车路径规划这类问题的计算时间。

这个算法由哈佛大学的研究人员开发,通过减少已有算法的迭代次数来快速解决优化问题。更出人意料的是,哈佛大学高级研究员Yaron Singer指出,这个方法并不以减少最终结果的精确度为代价。

优化问题是在可能的解中选出最佳答案,诸如映射从A点到B点的最快路径。许多专为解决优化问题设计的算法自从20世纪70年代首次被提出后便没有任何改进。

已有的优化算法通常是一个循序渐进的执行过程,迭代次数与所分析的数据量成正比。比如,一个电影推荐算法会依次找到每一部与用户喜欢的电影相似的电影。

然而,已有的优化算法存在"收益递减"的特性:随着算法的执行,每一步产生的相对收益变得越来越小。这意味着涉及海量数据的优化问题,寻找最优解的计算开销会极其昂贵。

在实验中,Singer和共同研究者Eric Balkanski发现他们的算法对包含6000名用户针对4000部电影的100万条评论数据集进行分析时,可以得出与现行算法相似的电影推荐结果,但速度却能提升20倍。

另外,对纽约市出租车公司与Limousine Commission的200万条出租车行车数据集进行分析时,新算法在为出租车挑选最佳位置时,不仅可以覆盖大部分潜在用户,而且比已有算法快6倍。

大部分已有的优化算法是通过单一方向的迭代运行来处理问题,而这一新的算法则采用多个方向并行实现。基于这样的方法,算法舍弃了不理想的优化方向,选取对结果最有价值的方向进行迭代。这种适应算法数据变化的方式,有助于解决收益递减问题。

这种策略可以发挥作用,得益于算法目标的两个不同方面。研究者称之为曲率(curvature)和同质性(homogeneity)。

对于电影推荐问题,具有高曲率的目标与用户看过的电影十分相似——例如,如果你喜欢Die Hard,那么算法推荐的电影很有可能包含这部电影的续集。对于出租车调度问题,具有高曲率的目标是出租车可以在30秒内响应客户的地方。曲率越平缓,算法越高效——例如,当一辆出租车的响应时间为5分钟而非30秒的时候,算法的效率更高。

同样对于电影推荐问题,具有高同质性的目标假设有许多电影可以推荐——例如,你喜欢Die Hard,高同质性的电影诸如Lethal Weapon 的同类型动作片会被算法推荐。对于出租车调度问题,具有高同质性的目标假设基于位置的客户分布相对均衡。同质性越高,算法越高效。

这种新的方法还可以用于解决其他问题,例如识别新药物、从在线健康社区发现药物间的相互作用以及开发医学成像的传感器阵列等等。

Singer说,"事实是我们确实能指数级得加速计算运行时间,这为医疗保健、计算生物学、机器学习和数据挖掘带来了新的契机,过去这些应用程序的计算成本太高,难以考虑太多因素。"

Balkanski和Singer正在探索他们的策略适用于哪些优化问题。他们同时也在计划为GPU编写代码,以在更多领域应用他们的成果。Singer表明,"一般来说,这些算法非常简单,几行代码即可实现。"。

Balkanski和Singer于6月28日在洛杉矶举行的国际计算机协会(ACM)的计算机理论研讨会(STOC)和7月12日在斯德哥尔摩的国际机器学习大会(ICML)上详细介绍了他们的成果。

]]> 原文: https://ift.tt/2MfpOFf
RSS Feed

机器知心

IFTTT

李飞飞CS231n项目:这两位工程师想用神经网络帮你还原买家秀

你有没有看过某个网红小姐姐穿了一件特别棒的衣服,然后急切地想找到同款?

你不是一个人——全球零售商都们都想用这个策略获利。

每当某个明星或者时尚博主在微博或者朋友圈po出一张图,这就是一次低成本的营销机会。随着网购与照片分享变得越来越流行,利用用户原创内容(UGC, User Generated Content)的市场营销策略已成为驱动流量与零售额增长的关键。通俗点说,一张漂亮的"买家秀"可能抵得过一票销售辛苦的游说。

相比于专业内容,"买家秀"的价值在于,以图像与视频为例,效果更加具有真实性。

然而,这也存在一定风险,因为很难控制内容质量及其产生的效果。

比如说:

来自微软的软件工程师Erika Menezes与Twitter软件工程师Chaitanya Kanitkar用AI工具建立一个深度学习模型,希望将买家衣物图像与网店中相同或相似的物品相匹配。

本项目为斯坦福大学2018年春季 CS231n课程作业的一部分。

链接:

https://ift.tt/1ERxZ3M

感兴趣的同学也可以查看大数据文摘在网易云专栏上的汉化版课程

网址:

https://ift.tt/2AC6sZD

这个"买家秀"还原问题被通称为买家到商家(consumer-to-shop)或街道到商店(street-to-shop)衣物检索问题。

本文将具体展示如何使用微软的机器学习平台Azure机器学习(AML)与Azure数据科学虚拟机(DSVM)快速推动该项目的开发。

图1.建立,训练与配置跨领域视觉搜索模型的微软AI平台架构图

定义问题

在买家到商家衣物检索问题中,我们试图将用户拍的图片(即一种UGC)与同一件衣物但是由专业摄影师按既定要求拍摄的图片相匹配。用户的图片一般都是手机拍摄,质量比店家的专业商品展列图片差很多。

具体来说,对于每一张新输入的UGC图片,我们希望返回k个与该图片最为相似的商品图片,并从中得到一件最匹配的商品。我们将需要定义一个距离度量函数,来量化被搜索图片与所有商品品类图片之间的相似度,并且根据其值排序得到k个最相似图片。

数据

本文数据采用Deep Fashion数据集的一部分。该数据集包括UGC图片及多种衣物类别的商品品类图片。我们使用四个最主要的衣物类别来进行实验:连衣裙,半裙,上衣与下衣。详见下图。

Deep Fashion数据集:

https://ift.tt/2lqznaX

图2.各类衣物图片数据量

Deep Fashion数据集

https://ift.tt/2lqznaX

图3与图4分别为买家与店家图片示例。这些例子展示了本任务的复杂性:匹配衣物的样式,但颜色不需要一致。

图3.(从左至右)图片1与2为买家衣服秀,图片3与4为同款店家衣服秀

从图3很容易看出,店家图片的质量较高,整件衣物都位于图片中央。买家数据集的挑战在于,每张图片都只对应唯一一个正确商品编码,所以有的与之非常相似但并不是同一商品的衣物就会导致模型精确度降低(请看图4)。为缓解此问题,我们使用Top-K准测来评估模型性能[QZ1](该方法也被用于衡量衣物相似度)。

图4.左一为买家衣服图。左二与左三为同一件商品的店家图。左四与左五为另一件非常相似但却是不同商品的店家图。

t分布随机邻嵌入(t-Distributed Stochastic Neighbor Embedding, or t-SNE)是一种将高维数据映射到二维空间的常用可视化方法。我们使用t-SNE将预训练ImageNet模型从买家图片中提取出的特征进行可视化,结果如图5所示。裤子的图聚类于左下部,而半裙则聚类于右上部。左半边的图片多为包括腿部的买家图片,而右半边的则是放在平面上拍摄的衣物图片。

图5.t-SNE处理后的买家图片ResNet50分类特征结果

方法

我们尝试了三种方法:

  • 白盒特征

  • 预训练CNN特征

  • 使用预训练CNN特征的孪生网络

下面详细介绍每一种方法。

1.白盒特征(White-Box Features)

我们第一个尝试的白盒特征图片提取器曾在计算机视觉上被广泛应用。特征先被提取,然后它们被连接起来以为每一张图片构造一种多特征的表述。我们在此提取了以下特征:

  • 方向梯度直方图(Histogram of Oriented Gradients),计算图像的每一细分区块内各梯度方向的发生次数。

  • 色彩直方图(Color Histograms),将图像中所有颜色划分为25个颜色区间并制作直方图以查看其分布。

  • 色彩一致性(Color Coherence),衡量每一像素的色彩与其所属大区块颜色的相似度。颜色是衣物非常重要的一个属性,因此本特征提取器是用于补充色彩直方图信息的。

  • 哈里斯边角侦测(Harris Corner Detection),提取图像中代表边角的特征点。

我们使用白盒特征计算了每一张买家图片的K近邻,并尝试了若干种标准距离度量函数(L1,L2,余弦函数)。结果如下图所示:

图6. 各类衣物白盒特征在不同距离函数下的表现

2.预训练CNN特征

在本方法中,我们使用预训练CNN模型对ImageNet上的1000个物体类别图像进行分类训练。

我们使用神经网络每层的激活函数作为特征表示。[w2] 我们在买家图像与店家图像上使用VGG-16,VGG-19,Inception v3和ResNet50进行训练,并且使用了L1作为度量函数。下图展示了上述模型的层数与参数数量。

预训练神经网络结构

图7展示了模型结果。总体来说提取特征表现有了很大的提高,ResNet50提取的特征在所有类别上都具有最好的整体表现。半裙类别达到了最好的结果,使用Top-20准确率达到了17.75%。

图7.各大类预训练CNN特征表现

在之前的方法中,我们分两步来计算距离函数。首先,我们使用低等级图像表征或预训练过的卷积神经网络最后一层隐藏层中提取出的特征,从图像中提取表征向量。然后将该向量代入标准化向量距离函数(如L1,L2与余弦函数)进行计算。然而在本方法中,我们使用提取出的买家与店家图像特征对来学习得到距离函数。这里我们使用孪生神经网络

3.孪生网络

孪生网络包含两个或多个完全相同的子网络。这些子网络基本上拥有一致的结构与权重。输入值被分别传入这些网络,最后输出时再合成一个单独的输出值。该输出值衡量输入值之间的距离。该网络使用这些输出值进行训练,最小化相似输入值之间的距离,以及最大化不同输入值的距离。详见图8。

图8.模型结构

我们使用对数交叉熵损失函数,其表达式如下:

这里的X1与X2分别为买家与店家图像特征,t则为目标值——相似特征对则为1,不相似特征对则为0。使用孪生网络以及预训练ResNet50提取特征,结果在几乎所有类别上都有总体表现上的提升(除了连衣裙大类)。最佳表现来自于半裙类别,Top-20精确度为26%。

图9.三种方法在各类衣物图片的表现对比 1) 白盒特征 2) 预训练ResNet50特征 3) 使用孪生网络相似度的ResNet50特征

下图是模型能够正确匹配衣物的例子(见图10),其中排名前20的另外那些返回值也都直观上非常相似,他们基本都是同一件商品或相似商品不同颜色或不同材质。

图10. 前20位正确与错误匹配图(错误匹配中仅显示两张图)

应用数据科学虚拟机与Visual Studio AI集成开发工具

本部分中我们将展示如何使用数据科学虚拟机以及Visual Studio AI集成开发工具来开发深度学习模型。此外,我们还将解释如何使用Azure机器学习以通过类似API的方式操作模型。

数据科学虚拟机

数据科学虚拟机(DSVM)为Azure虚拟机镜像。它被预先安装、配置并测试。所用工具在数据分析、机器学习及人工智能训练中非常流行,如GPU 驱动以及深度学习框架(比如TensorFlow)。它帮助你在配置上节约大量时间,提高工作效率。

数据科学虚拟机:

https://ift.tt/2fScoEp

Visual Studio AI集成开发工具

Visual Studio AI集成开发工具是一个用来建立,测试并部署深度学习/人工智能应用的拓展功能。它与Azure机器学习无缝集成,并提供强大的实验鲁棒性——包括但不限于,向不同计算目标完全透明地提交数据准备与模型训练任务。此外,它还提供自定义衡量指标与历史记录追踪;实现了数据科学的可复用能力与审查能力。

Azure机器学习

Azure机器学习服务为数据科学家与机器学习开发者们提供了处理数据、开展实验、建立、管理并部署机器学习与人工智能模型等的一系列工具。它们允许使用任何Python工具与库。你可以在Azure上使用各种数据与计算服务来存储并使用数据。

训练

我们使用Azure机器学习命令行界面(Command Line Interface,CLI)和VS Code来将我们的数据科学虚拟机建立为一个远程计算目标,"my_dsvm",并借此提交训练指令来运行实验。

图11.Azure机器学习CLI配置VS Code编辑器界面

部署

我们将模型与代码部署成网页服务的形式,从而可通过REST方式访问。为此,我们使用AML操作模型,结合Visual Studio AI集成代码工具以及Azure机器学习来进行部署,如下所示:

az ml service create realtime -f score.py –model-file model.pkl -s service_schema.json -n outfit_finder_api -r python –collect-model-data true -c aml_config\conda_dependencies.yml

这将使得任何使用REST API的用户都可以使用模型。

详细的部署指导:

https://ift.tt/2LnTaRb

总结

本文中我们讨论了如何建立一个深度学习模型来对买家服装图像与网店相同或相似商品图像相匹配。我们展示了如何使用Azure的数据科学虚拟机与Visual Studio AI集成代码工具来快速开始建立、训练与部署模型。我们还展示了如何使用Azure机器学习来轻松操作模型。

代码链接:

https://github.com/ckanitkar/CS231nFinalProject。

编者注:Top-K Accuracy即,在返回的前K个结果中,只要出现了正确的预测结果,则该数据点被记为"正确预测"。

相关报道:

https://ift.tt/2J7GWul

]]> 原文: https://ift.tt/2va6XoM
RSS Feed

机器知心

IFTTT

1,000,000,000,000!苹果市值破万亿!16 倍市盈率

苹果成为第一家市值超万亿的美国企业!

7 月 31 日苹果发布了截至 2018 年 6 月 30 日的 2018 年第三季度财报。据官方数据,苹果在 2018 年第三季度的营收达 533 亿美元,比去年同期提高 17%。稀释每股收益为 2.34 美元,同比增长 40%。国际销售额占本季营收的 60%。

iPhone 营收为 299.06 亿美元,同比增长 20%。iPad 与 Mac 的营收分别为 47.41 亿美元和 53.3 亿美元,同比都下跌了 5%。增长最快的业务是服务和其他产品,营收分别为 95.48 亿美元和 37.4 亿美元,同比增长分别为 31% 和 37%。

苹果 CEO Tim Cook 称:「这是苹果史上最佳的 Q3 财报,也是苹果连续四个季度实现两位数的营收增长。」苹果 Q3 财报结果主要受 iPhone、服务和可穿戴设备的强劲销售的支持。

据悉,受强劲的业务表现的推动,苹果在全球各个地区的营收都出现了增长,净收益达 115 亿美元,营运现金流 145 亿美元。苹果 CFO Luca Maestri 称:「苹果本季度向投资者回报了 250 亿美元,其中 200 亿美元来自股票回购。」

从报告中可以看出苹果这一季度的成绩超出了自身预期以及分析师的估计。财报发布后引起股市快速上涨,今晨苹果市值突破万亿。

更重要的是,16 倍 P/E(市盈率)。

美国东部时间上午 11:48,苹果每股股票超 207.05 美元(不过之后股价有稍微回落)。鉴于股市不稳定的性质,很可能苹果市值超万亿不会持久,或者未来一段时间苹果市值会在一万亿上下波动。从技术层面上来看,苹果不是首家市值超万亿的企业,中石油 2007 年即短暂地到达一万亿市值,不过很快就跌落了。

但是综合来看,苹果是第一家美国(目前且唯一的)万亿市值企业。这种情况或许不会持久,因为亚马逊 Q3 财报显示其也在突破一万亿的边缘。

当然,所有这些都只是人类对于「好看」数字的一种偏好。实际上苹果市值 9990 亿和一万亿美元差别不大,它仍然是一家富有、有影响力的企业。

但是,对资本来说呢?

]]> 原文: https://ift.tt/2LLFmV4
RSS Feed

机器知心

IFTTT

Google将推中文信息流产品,今日头条们请注意

李根 发自 凹非寺 量子位 报道 | 公众号 QbitAI

一周前,Google通过微信小程序游戏"猜画小歌",着实秀了一把AI实力。

作为全球第一AI大厂,一款小程序游戏又怎能足够?

据The Information爆料,Google还要发布一款中文信息流产品。

当然,肯定是AI驱动。

中文信息流产品

关于这款中文信息流产品,跟Google翻译、猜画小歌一脉相承,据称照样基于移动端、大概率是手机App,重点是为中文信息而生。

之前呢,Google已经推出了面向英语世界的信息流产品。类比起来,跟今日头条干的事情差不多,都是聚集信息,然后依照用户行为画像,通过机器学习的方式,实现"千人千面"。

但实际的个性化效果如何,大洋两岸收获的评价都差不多。

大洋东岸,Google的英文信息流产品引起的反响有限,也还不算爆款应用,而且提供的中文内容也相对有限。

太平洋西岸,不管是已经推出近6年的今日头条App,还是2017年强势进击并喜提业绩的百度,训练的AI都比Google要更懂中文,但仍然被不少用户认为"没那么精准"。

所以即便Google之前已有Google翻译、猜画小歌等成功AI产品,也不能说明Google将要推出的这款中文信息流产品可以延续成功,但机会总归还是有一点。

Google新产品具体发布的时间,现在也没个准数,有说今年年底,也有消息说最快得明年。

新产品具体什么样子,还不得而知。作为参考,Google在海外的信息流应用,其中提供的中文内容,如下图所示。

这款中文信息流产品之所以提前走漏风声,是因为跟一个特殊项目密切相关。在Google内部,专门搞了一个面向中文用户的AI产品开发计划,而信息流产品,只是其中之一。

Google发言人也嘴严得很,先PR了一波已经发布的中文AI产品,接着表示近期还给京东投出了5.5亿美元——一直都在关注中国公司和中文开发者群体,但最后也表示,对于计划中和未来的事情,现在啥也不能说。

不过也不是完全没有"蛛丝马迹"。

合作方?腾讯?

Google要推出中文AI产品,很大程度上会有国内合作方。

虽然AI驱动下的信息流产品,已经不需要太多人类编辑,但比起英语来,中文肯定要难很多。

而且信息流产品,AI技术是一方面,数据量是另一方面。

今日头条和百度生于斯长于斯,尚且被吐槽不够精准,Google想要马上就做出感动人心的产品,并不容易。

所以最直接的方式是有中文合作方,而且有消息说——Google会跟腾讯合作。

Google和腾讯发生关联,其实在今年1月份就有过"重要风向标",当时腾讯宣布和Google达成专利交叉授权许可协议,通告中称合作价值超过5000亿美元。

更早之前,Google就跟搜狗有过内容相关的合作,而今年又大手笔投资了京东,这可都是企鹅生态中的重要盟友。

而且还有两个小道消息。

一是Google今年新设立了一个深圳办公室。

二是最近一个高规格会上,腾讯总裁刘炽平跟Google CEO皮猜相谈甚欢,私聊了好长时间。

不过这些都只是一些"蛛丝马迹",真实情况如何,需要等产品发布和官方消息为准。

稍微有点小期待的是,Google会不会因为这款中文信息流产品,开招一些非AI非CS专业的员工呢?

能去Google当小编,不是也很好吗?

嗯,就酱~

欢迎大家关注我们的专栏:量子位 - 知乎专栏

诚挚招聘

量子位正在招募编辑/记者,工作地点在北京中关村。期待有才气、有热情的同学加入我们!相关细节,请在量子位公众号(QbitAI)对话界面,回复"招聘"两个字。

量子位 QbitAI· 头条号签约作者

վ'ᴗ' ի 追踪AI技术和产品新动态



via 量子位 - 知乎专栏 https://ift.tt/2Km5eRZ
RSS Feed

RSS5

IFTTT

Google将推中文信息流产品,今日头条们请注意

李根 发自 凹非寺 量子位 报道 | 公众号 QbitAI

一周前,Google通过微信小程序游戏"猜画小歌",着实秀了一把AI实力。

作为全球第一AI大厂,一款小程序游戏又怎能足够?

据The Information爆料,Google还要发布一款中文信息流产品。

当然,肯定是AI驱动。

中文信息流产品

关于这款中文信息流产品,跟Google翻译、猜画小歌一脉相承,据称照样基于移动端、大概率是手机App,重点是为中文信息而生。

之前呢,Google已经推出了面向英语世界的信息流产品。类比起来,跟今日头条干的事情差不多,都是聚集信息,然后依照用户行为画像,通过机器学习的方式,实现"千人千面"。

但实际的个性化效果如何,大洋两岸收获的评价都差不多。

大洋东岸,Google的英文信息流产品引起的反响有限,也还不算爆款应用,而且提供的中文内容也相对有限。

太平洋西岸,不管是已经推出近6年的今日头条App,还是2017年强势进击并喜提业绩的百度,训练的AI都比Google要更懂中文,但仍然被不少用户认为"没那么精准"。

所以即便Google之前已有Google翻译、猜画小歌等成功AI产品,也不能说明Google将要推出的这款中文信息流产品可以延续成功,但机会总归还是有一点。

Google新产品具体发布的时间,现在也没个准数,有说今年年底,也有消息说最快得明年。

新产品具体什么样子,还不得而知。作为参考,Google在海外的信息流应用,其中提供的中文内容,如下图所示。

这款中文信息流产品之所以提前走漏风声,是因为跟一个特殊项目密切相关。在Google内部,专门搞了一个面向中文用户的AI产品开发计划,而信息流产品,只是其中之一。

Google发言人也嘴严得很,先PR了一波已经发布的中文AI产品,接着表示近期还给京东投出了5.5亿美元——一直都在关注中国公司和中文开发者群体,但最后也表示,对于计划中和未来的事情,现在啥也不能说。

不过也不是完全没有"蛛丝马迹"。

合作方?腾讯?

Google要推出中文AI产品,很大程度上会有国内合作方。

虽然AI驱动下的信息流产品,已经不需要太多人类编辑,但比起英语来,中文肯定要难很多。

而且信息流产品,AI技术是一方面,数据量是另一方面。

今日头条和百度生于斯长于斯,尚且被吐槽不够精准,Google想要马上就做出感动人心的产品,并不容易。

所以最直接的方式是有中文合作方,而且有消息说——Google会跟腾讯合作。

Google和腾讯发生关联,其实在今年1月份就有过"重要风向标",当时腾讯宣布和Google达成专利交叉授权许可协议,通告中称合作价值超过5000亿美元。

更早之前,Google就跟搜狗有过内容相关的合作,而今年又大手笔投资了京东,这可都是企鹅生态中的重要盟友。

而且还有两个小道消息。

一是Google今年新设立了一个深圳办公室。

二是最近一个高规格会上,腾讯总裁刘炽平跟Google CEO皮猜相谈甚欢,私聊了好长时间。

不过这些都只是一些"蛛丝马迹",真实情况如何,需要等产品发布和官方消息为准。

稍微有点小期待的是,Google会不会因为这款中文信息流产品,开招一些非AI非CS专业的员工呢?

能去Google当小编,不是也很好吗?

嗯,就酱~

欢迎大家关注我们的专栏:量子位 - 知乎专栏

诚挚招聘

量子位正在招募编辑/记者,工作地点在北京中关村。期待有才气、有热情的同学加入我们!相关细节,请在量子位公众号(QbitAI)对话界面,回复"招聘"两个字。

量子位 QbitAI· 头条号签约作者

վ'ᴗ' ի 追踪AI技术和产品新动态



via 量子位 - 知乎专栏 https://ift.tt/2Km5eRZ
RSS Feed

RSS5

IFTTT

DeepSeek + Pi 王炸组合跑赢 Claude Code?-InfoQ每周精要No.935

「每周精要」 ...