数据标注还能更快!谷歌发布图像标注机器学习辅助工具

基于深度学习的现代计算机视觉模型,其性能主要取决于的大量已标注的可用训练数据集,例如 Open Images 数据集。然而,如何获得高质量的训练数据,成为计算机视觉发展的主要瓶颈。如在无人驾驶、机器人和图像搜索之类的应用中,使用的一些像素级目标预测任务,比如语义分割任务,格外的需要更大更好的数据集。事实上,传统的手工标注工具需要标注人仔细点击图像中每个对象的边界,用来划分图像中的目标,这项工作非常乏味:COCO+Stuff 数据集中标注单个图像就需要大概 19 分钟,而标记整个数据集甚至需要 53000 个小时!


左图| COCO 数据集中的一张图片; 右图|左图的像素级语义分割结果。(来源:Image credit)


谷歌的研究人员设计了一种机器学习驱动的工具,将在 2018 年 ACM 多媒体会议的“ Brave New Ideas ”环节展示,可以用于标注图像数据中每个目标的轮廓和背景,将其应用在标注分类数据上,可以让标记数据集的生成速度提高至传统方法的 3 倍。


该方法被谷歌称之为流体标注(Fluid Annotation),从强语义分割模型的输出开始,人工标注者可以使用用户界面,通过机器辅助方法进行编辑修改。谷歌开发设计的界面允许标注者选择要改正的内容和顺序,让他们能集中精力去处理机器尚未理解和标注的图像。


图 | 对 COCO 数据集中的图像使用流体标注的可视化界面。(来源:gamene)


为更准确的对图像进行标注,谷歌首先通过预训练的语义分割模型(Mask-RCNN)来处理图像。这一过程会生成约 1000 个图像分割区域及其标签和置信度。置信度最高的分割区域用来初始化标签,呈现给标注者。


然后标注者可以:


(1)从机器生成的候选分类标签中为当前区域选择标签。(2)对机器未覆盖到的目标添加分割区域。机器会识别出最可能的预生成区域,标注者从中选择分割效果最好的一个。(3)删除现有分割区域。(4)改变重叠区域的深度顺序。


Demo 链接:

https://fluidann.appspot.com(PC 平台可用)


图 |使用传统人工标注工具(中列)和流体标注工具(右列)在 COCO 数据集的三张图像上比较标注结果。虽然使用人工标注工具时,目标的边界一般更准确,但同一对象的标注有时会存在差异,其主要是因为人类标注者通常对某一确定目标的类别有不同意见。图片来源:sneaka(上),Dan Hurt(中),Melodie Mesiano(下)。


在让图像标注变得更快、更容易这个问题上,流体标注工具的出现只是第一步。未来团队的目标是改进对目标边界的标注,进一步利用人工智能提升界面运行速度,最终可以处理以前无法识别的类别,让数据收集变得越来越高效和快捷。

推荐文章

标注网站使用方法  一、网站使用方法 1、 网址 http://tag.fanhantech.cn:8088/login  (请务必使用谷歌或火狐浏览器) 2、 每个团队需要将账号前缀申请为一致,必须为一致。申请后请将所有账号用户名写到同一个Excel发给我们。我们将开通做正式任务的权限。同时也将指定质检账户发给我们,我们也会开通对应任务的质检权限。 注册之后可以进入test001任务做测试,此测试任务只做测试使用。 3、 登录之后请点击对应的任务进入,单后点击“开始赚钱”进入正式任务界面。 4、 下图为任务界面的整体介绍。  二、标注小技巧 1. 标注时候不要随意删除音频截取框,因为一旦删除之后没法恢复,只能是调节其他的来补充。 2. 在最开始做任务的时候务必慢一些,务必对规则有详细全面的了解。 3. 如果有问题务必及时确认。 4. 同一条音频在接到之后务必在5个小时内一次性完成并提交。系统不支持缓存。五个小时内没有提交当前的音频会造成当前任务回收,最后提交失败。 5. 同一条音频在编写的时候可以边听边写,尽量不要听完再写。   音频标注规范  每个团队要对自身的数据质量做监控和质检,保证提交的数据达到质量要求。标注要求正确率为95%或以上。如提交的数据未达标,需优先返工问题数据。  一、标注员行为规范 标注员需要严格执行以下的标注员行为规范:1. 严禁向外传播标注语音,如出现标注语音泄漏的情况,我们将追究相关人员的责任;2. 杜绝一切不认真、不负责任的标注行为;3. 标注中出现的问题应及时反映;4. 所有标注人员需要与我们签订保密协议。 二、切割规则1)所有音频已经进行过预切割处理,但是需要对预切割的音频进行检查,如有必要需要进行微调或新增。2)每段音频中只能包含有一个说话人,但是同一个说话人的同一句话可以切割为连续的两段甚至多段音频。三、标注规则 符合以下情况的属于无效音频:1) 不包含有效的可懂语音(听不懂的方言、其它国家语言等)。2) 环境噪音较高(完全听不清音频中的内容或音频中的内容比较模糊)。3) 全部属于多人同时说话(多人在同一个内容区域中的对话或聊天)。4) 发音和语义都不确定的情况。5) 空音频,没有人在说话。无效音频不包含任何有效内容,不进行转写。 标注的基本原则是:文字与声音完全对应,不要试图修正发音过程中的语法错误,例如,“我走了”误读成了“我了走”,要按照实际发音书写。当发言人出现多个对象时,客服人员标注为A,用户标注为B,如果一方不只一个人,则标注为A1、A2、B1、B2...对象与发言内容之间以空格隔开,不加标点。1) 所有阿拉伯数字需要转写为对应语言的数字文字写法,如:一,四,其中,数字“1”根据实际发音写为“一”(音yi1)或者“幺”(音yao1);2) 所有读出来的标点符号都要直接用对应字或词在相应位置写出。例如“领导:”如果“:”被读出,则写成“领导冒号”;3) 句子断句不使用标点符号,除固定噪音类型外,不间隔。4) 因口音问题造成的误读,不需要修改。例如因为口音问题使得“四十”听起来像“事十”,则不需修改;5) 中文中出现英语单词按照单词习惯出现格式转写即可。例如:apple,Paris6) 非单词的英文(包括缩写及无意义的字母组合)用大写英文字母标注,字母间加空格:如M A R C、工号D S Z三九五八【文本中不允许出现全部由大写字母组成的单词。】7) 专有名词如是知名人士或地名机构按真实名称标注,普通人名或地名按常见文字标记。如果中文名和英文名的发音相近,请使用中文名称。例如,记录下阿里巴巴而不是Alibaba。 8) 发现听的比较清楚,但是语义不确定,但是发音可以确定,比如普通人名等,可以选择同音字代替,但需要保证标注读音正确,包括音调正确。9) 商标、品牌、注册名等都应以其原有、专有的格式出现,    例如: Hotmail dot com    而不是     hot mail dot com10) 儿化音、填充语气词需标出11) 当音频中出现两人同时说话时,重叠部分用*时间点*表示。例如:客服说的“你好上海”,“上海”是重叠部分,就标注A你好 *0:48.261 0:48.661*(重叠、方言都是按此方法标注)12) 当音频出现方言时,方言部分用**表示,并且加入时间段。当音频出现方言时,把方言的地方用**表示,当中标明时间点。(和听不清的要分开处理,听不清的不需要在其中加入时间点,参考下方标签表格)例如:客户问对方你会不会说潮州话之后出现一句方言,标注为:B你会不会说潮州话 *0:47.204 0:48.661*(重叠、方言都是按此方法标注)当方言属于接近普通话的发音,个别内容听不懂时,接近普通话的部分作为口音直接转写内容,听不懂的部分作为方言处理。方言是否能听懂都按照无效音频处理。13) 当电话未接通,出现语音提示如“您拨打的电话正在通话”时,对象标注为Y。 出现下表中的噪音情况时,将对应符号标在对应声音出现的位置,与前后单词之间有空格。  符号(标签)对照表:  序号噪音名符号噪音概念及标注规范1背景持续噪音<STA/>用于标注非预期的背景持续噪音,即噪音持续整个语句。使用时标在句首和后面文字之间有空格。非预期背景噪音指除了录音要求环境的噪音(餐厅背景音乐及他人说话,街道风声及路上会出现的各种固有噪音,地铁站台中人流声及地铁驶过声音及广播声等)2突发的非语音类噪音<NON/>突发的非语音类噪音,如关门声,敲击声,鸣笛声等等。使用时标在对应声音出现的位置,与前后单词之间有空格。如噪音发生在字的中央位置,则标注在此字之前。如在句首标注则之前不需要空格。3无实际意义的语气词(本人发言状态)<FIL/>发音人发出的无实际意义的语气词,如:嗯,哦,啊,呃等等。使用时标在对应声音出现的位置,与前后单词之间有空格。如在句首标注则之前不需要空格。4无实际意义的语气词(非本人发言状态)<RSP/>一方在发言时,另一方处于附和等目的,发出的无实际意义的语气词,如:嗯,哦,啊,呃等等。使用时标在对应声音出现的位置,与前后单词之间有空格。如在句首标注则之前不需要空格。5语音噪音<SPK/>发音人发出的语音噪音,如大喘气,咳嗽,笑,叹气,喷话筒等。使用时标在对应声音出现的位置,与前后单词之间有空格。如噪音发生在字的中央位置,则标注在此字之前。如在句首标注则之前不需要空格。 6非发音人发出的语音噪音<NPS/>非发音人发出的语音噪音,本次标注由于选择噪音环境中会出现其他人噪音,则只用来标注突发的、能清楚听到内容的他人语音。使用时标在对应声音出现的位置,与前后单词之间有空格。如噪音发生在字的中央位置,则标注在此字之前。如在句首标注则之前不需要空格。7听不清**无法听清或者不知道说的是什么的字或词。直接用此符号代替不知道是什么的单词或在听不清的地方用此符号代替。例,microsoft这个单词被读成microhaf,则用**代替文本中microsoft这个词。与前后单词之间有空格。如在句首标注则之前不需要空格。比如有人说“xi 星期一”是转写为‘** 星期一’。8无效W 无效标准请参照前文(以这个写法为准,请忽略系统中的无效标签) 9空白K 被截取的整段短音频为完全空白则标注为空白,不需要刻意将空白音频单独截取。 10系统语音提示X 所有系统语音提示,如“您拨打的电话正在通话”时。  

热门文章

滴滴语音标注规则要求及视频教程
一、标注环境1. 请使用谷歌浏览器进行标注。2.标注平台地址:http://label.xiaojukeji.com/labelerTaskList二、标注内容1. 语音有效性标注无效语音请在有效性一项选择“无效”,并在标注文本一项标注大写字母“NULL”。有效语音请在有效性一项选择“有效”。当语音出现下列任意一种情况,即可标注为无效语音:1) 说话人声音极小,小到几乎听不到。2) 整段语音均为静音。3) 整段语音均为噪声、音乐声、导航音、广播等。4) 整段语音只有一个字,或是同一个字重复出现。如:“嗯”、“对”、“对对对对”、“啊”、“喂”、“拜拜”、“谢谢”、“好好好”、“OKOK”等。(注意:“哇噻”属于特例,单独出现时也是无效的。)5) 背景噪声大于说话人声音,或噪声与说话人声音几乎一样大。6) 整句都是方言、外语。方言是指发音与普通话区别较大的地方话,如:粤语、上海话等。7) 语音中出现地点、地名、街道名等方位词,但是地图中搜索不到。8) 语音中有大于等于两个人说话,除主说话人以外,其余人的声音清晰可辨。9) 语音中有大于等于3个字听不清楚。 2. 语音文本标注1) 语音文本内容将说话内容写成文字。要求转写的文本内容必须和听到的语音完全一致,不能多字、少字。a) 除空格、占位符号、以外,标注文本不允许使用标点符号,不允许换行。b) 说话人犹豫、口吃导致出现重复的字也要标注出来,重复了几次就标记几个。如发音为:我是北北京人;“北”字有重复现象。转写文本应为:我是北北京人c) 儿化音不需要标注出“儿”字。如发音为:我在/zher4/。转写文本应为:我在这d) 语音中提及地名、街道名、车牌号等内容,转写时需符合日常习惯。选用“路”、“街道”、“门”、“座”、“桥”等地名常用字以及“京”、“津”、“冀”等车牌号常用字。e) 语音中提及地名、街道名、店铺名、专有名词,需要准确转写。可根据读音在地图中查找,确实存在该地点则进行准确标注,搜不到则无效;f) 语音中确实听不清楚的个别单字,用占位符号【~】标记。一组【~】符号代表一个字。在整段语音中,最多只能有两组【~】符号。若有三个字或更多听不清楚,则标注为无效。(见“语音有效性标注”第8条)g) 语音中不涉及地名、专名的部分,若发音清晰但文字不确定,可以用同音字标注,要求标注用字的声韵调与实际发音完全一致。如发音为:我姓/zhang1/。标注成“我姓张”或“我姓章”都算正确。h) 数字要写成汉字形式,注意区分“一”和“幺”、“二”和“两”,按实际读音写。i) 英文字母要转写成大写字母。j) 音频中说话人清楚说出的语气词,如“呃、啊、嗯、哦、唉、呐、呢”等,要按照正确发音进行转写。语气词除了“了、不”没有口字旁,其他基本上都有口字旁。注意:语气词“唉”、“诶”不分的,统一用“唉”。 3.语言情况标注1)语音中全部内容均为中文,请选择“中文”。2)只要语音中含有英文,不论是单个字母还是单词、不论出现的数量有多少,都需要选择“英文”并且字母全部大写。1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于OK这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的及时与我们沟通 4. 说话人性别标注按说话人的音色实际情况进行标注。若无法明确区分男女,不论是成人还是儿童,都标注为“女”。三、标注常见问题总结1. 短句如何判断有效性?答:短句只要有大于或等于两个不重复的音节,即为有效。例如“嗯好的”、“明白”、“可以”等。 2. 有明显口音,但能听懂,需要标注吗?答:口音但不影响理解的,音频中个别几个字的方言可以使用同音字标注。听不清音节的方言也无法使用同音字标注的,可以使用【~】,大于或等于三个字需使用【~】符号的情况下。参照“语音有效性标注”第8条规则,标记为无效。 3. 标注时有的口音能听懂,是按听的音来标注还是按普通话来标注,标注需要符合现实逻辑吗?答:一般情况下口音按实际发音来标注。以下情况请特别处理:常用词语和专有名词需按现实逻辑标注(如:发音是“现/xian4/生”标为“先生”,“滴滴专/ce1/”标为“滴滴专车”等等) 5. 音频中一串数字如【12531】转写为一二五三一还是吆二五三吆?答:转写的文本要和语音实际读法完全一致。若读为yi1,则写一;读为yao1,则写幺。同理,“二”、“两”、“俩”;“三”、“仨”也需要区别使用。 6. 一段很短的音频中语速过快,有时候听起来像三个字又像两个,是不是都能判断合格?答:短音频且内容无法听清的情况下,标记为无效。长音频中很小的一部分,无法确定内容时,参照“语音文本内容”下f项、【~】符号使用规则进行。 7. 一段音频中语速过快,能听清某些音节但大多部分不能做出准确判断写不出是否可以判断无效?答:判断为无效 8. 一段音频中出现导航仪发出的声音或者只有导航仪的声音算噪音吗?答:整段只有导航音,标记为无效。只有一部分出现导航音的时候,看声音大小,如果与说话人音量接近或者大于说话人声音,标记为无效。 注意:如果一句话里面只说了几个字方言,其他都是带口音的普通话,不要直接标无效,那全方言的字按听到的音来标,比如:说的是上海话gege,就标成“葛个”,而不是标成“那个”。语气词无法转写的可以找同音字或相近音字转写;全方言无效 关于地点、地名、街道名等方位词,这些词我们需要使用地图搜索引擎搜索如果地点、地名、街道名等词语很长且词发音很清晰,但使用地图搜索引擎搜索不到这个地点。即使这句话其他部分可以完整的转写出来,但依旧视为无效。二、关于英文转写原规范为:英文字母要转写成大写字母。        细化:1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于 OK 这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的,我们及时向海瑞提出。三、噪音符号这部分,这部分依旧不用添加。 四、关于标普、方普、方言如何转写    1、标普:就是普通话,我们是一定要转写的。    2、方普:就是方言普通话,例如广州人说普通话,上海人说普通话,天津人说普通话等等,这些是需要转写的。只是他们在说普通话的时候会有一些口音。例如发音说:我现在湖南(fu2声 lan2声)长沙市中心你来接我一下     他说的是“fu lan”我们正常书写成“湖南”即可。    3、方言:直接视为无效即可,例如:粤语、上海话、江苏话等等。