让机器会说更生动的句子，阿里巴巴论文入选计算机视觉顶级会议

2017-07-28

这是阿里巴巴本月内第三次公布论文入选国际顶级学术会议的好消息。

【猎云网（微信：ilieyun）北京】7月28日报道

7月28日，阿里巴巴的“NASA大脑”iDST（Institute of Data Science Technology）表示，《Hierarchical Multimodal LSTM for Dense Visual-Semantic Embedding》入选2017年国际计算机视觉大会ICCV，即计算机视觉领域的顶级会议之一。

这也是阿里巴巴本月内第三次公布论文入选国际顶级学术会议的好消息。

据了解，这篇论文涉及的是计算机视觉（Vision）和自然语言处理（Language）两个独立领域结合的学术研究，提出了对图像（或图像显著区域）更为细致精确的描述，显示出阿里巴巴在Vision&Language研究方向的持续挖掘。

该论文通过创新的多模态、层次化的递归神经网络（Hierarchical Multimodal LSTM）方法，可以将整个句子、句子中的短语、整幅图像及图像中的显著区域同时嵌入语义空间，并且自动学习出“句子-图像”及“短语-图像区域”间的对应关系，生成包含更多形容词的稠密语义空间，对图像或图像区域进行更详细和生动的描述。

777C04AE-FBC7-4BA8-AF28-B1872AB687F3

也就是说，计算机以后不仅能说“一只鸟站在树枝上”，还能说出“一只羽翼未丰的小鸟站在春天抽芽的树枝上”、“一只张嘴乞食的小鸟”、“一只小鸟站在抽芽的树枝上，扑腾翅膀学习飞翔”这样更为生动复杂的句子。

B5A6395B-F82B-4F05-A1AF-DCE84A8E6F5E

论文作者介绍，这一研究将被用于“看图说话（Image Captioning）”任务及其他颇有意义的应用场景。如应用于自动导盲系统，将拍摄的图像转换成文字和语音，以便提示盲人避障。

此外，还能用于“跨模态检索（Cross-media Retrieval）”任务，当用户在电商搜索引擎中输入一段描述性文字如“夏季宽松波西米亚大摆沙滩裙”，系统就能为用户提供最相关的商品。

ICCV全称为IEEE International Conference on Computer Vision，与CVPR（计算机视觉模式识别会议）和ECCV（欧洲计算机视觉会议）并称计算机视觉方向的三大顶级会议。

在本月早些时候，阿里巴巴先后发布三篇论文入选国际多媒体会议ACM MM，四篇论文入选国际计算机视觉与模式识别会议CVPR的消息。

今年3月，阿里巴巴宣布启动NASA计划，要为未来20年研发核心科技。在这一计划的号召下，阿里正在人工智能领域全面发力，在机器学习、视觉识别等领域不断追赶世界顶尖的学术水平。

阿里巴巴

打开猎云网APP，查看原文

猎云网APP阅读全文

体验更加

微信扫码关注猎云网

猎云网原创文章未经授权转载必究，如需转载请联系官方微信号进行授权；
转载时须在文章头部明确注明出处、保留官方微信、作者和原文链接，如：转自猎云网(微信号: lieyunjingxuan )字样；
猎云网报道中所涉及的融资金额均由创业公司提供，仅供参考，猎云网不对真实性背书。
联系猎云，请加微信号：jinjilei

让机器会说更生动的句子，阿里巴巴论文入选计算机视觉顶级会议

{{item.post_title}}

{{item.title}}

同程旅行：“分段式过年”火爆，节中民航出行热度较去年春节同期提升38%