数据标注这份工作,不是你想做就能做

        想给Google标数据,你得先拿到医师资格证才行。

        同样的目前数据标注行业的发展还很混乱,没有相应的门槛就导致出各方面的问题,行业准入,门槛标准,人员素质,数据安全这些问题迫切需要加强规范。目前国内已经有郑州点我科技在做这方面的行动了,据点我科技方面透露目前他们申请的数据行业标注员培训证书的国家认证即将要审核下来,接下来公司会围绕着数据标注员的培训方面做工作。目前从项目方业务标注公司的调研来看标注员从业资格认证将从 行业发展、标注规范、业务标准、数据安全,保密规则等方面做培训以引导行业人员各方面素质的提高。

  在一排一排的电脑前,这里的年轻人们一边浏览照片和视频,一边标记他们看到的每样东西。有的是在为无人驾驶公司标注路上的汽车和红绿灯,有的是在为无人售货公司标注面包牛奶巧克力。

河南省郏县睿金科技公司总部的工人正在标注数据河南省郏县睿金科技公司总部的工人正在标注数据

  据《纽约时报》的报道,在位于中原腹地的河南河北,数据标注正在渐渐成为最新的劳动密集型行业。

  有多少人工,就有多少智能。目前的人工智能在被投喂了大量数据之后,才能认出三岁小孩子都能认出的东西,学会“黑猫白猫都是猫”。

当然,狸花猫也是猫当然,狸花猫也是猫

  然而,在人工成本更高以及对数据标注要求更复杂的硅谷,工程师们需要寻找其他出路来获取大规模的高质量有标记数据。

  众包

  在人工费用高昂的硅谷,工人的最低时薪约为13美元左右。对于很多创业公司和中小企业来说,雇工人标注数据实在承受不起。最经济的方法就是把大量任务拆分成小任务,再以低廉的价格分发到用户手中。

  其中最有名的在线众包平台就是亚马逊旗下的AmazonMechanicalTurk了。

  在MechanicalTurk上,发布者可以自行上传标注任务,用户只需要填写简单的个人信息就可以开始工作。为了搞清楚 MechanicalTurk到底是怎么工作的,硅星人也注册了一个账号。

  在 MechanicalTurk的开始页面,有各种奇奇怪怪的任务。这其中包括“标注厨房里的事物”,“找出电子邮件地址和发件人名字”,“给图片中的物体勾线”等等。

  每个任务中包含若干个被称为HIT(人类智能任务,HumanIntelligenceTask)的小任务,标注员每完成一个小任务可以获得相应的报酬。

  其中最便宜的一个是给图片中的建筑分类,判断这个小楼是属于拉丁裔、亚裔还是中东人。每完成一个可以获得1美分(约7分人民币)报酬。

而最贵的一个,是找一位中文母语者按要求录150句中文,可以获得6美元。而最贵的一个,是找一位中文母语者按要求录150句中文,可以获得6美元。

  除了这些简单易懂,点一下鼠标就能完成的任务,在 MechanicalTurk上还有更多高要求的标注工作。

  比如,有一个任务要求标注者看10秒钟视频,并用一句话描述视频里的内容。在描述时,不能出现拼写和语法错误,也不能加以主观臆断,在囊括所有重要内容的同时又不能描述太多不重要的细节。

  而实现这么一个高要求的任务,发布者只需要付出0.3美元赏金。

建议家长拿这个玩意儿训练小朋友写英语短句建议家长拿这个玩意儿训练小朋友写英语短句

  尽管任务复杂报酬低廉,MechanicalTurk上的任务还是供不应求。一些低要求的工作被放出来不到十秒,就被抢光了。

  截至2011年1月,MechanicalTurk上的注册工人数量已经达到了50万,在这些人的帮助下,有无数资金不充裕的人工智能研究得以实现。

  此外,在网站输入验证码时,其实我们也在顺便做数据标注,只不过得不到报酬罢了。

比如这种标出路牌的验证码比如这种标出路牌的验证码

  而其实, MechanicalTurk(直译为机械土耳其人)的名字早就剧透了人工智能训练的本质。

  1769年,初代 MechanicalTurk的发明者——匈牙利机械师沃尔夫冈·冯·肯佩伦制造了一个“能战败人类”的下棋木偶。这个“智能”木偶在欧洲和美洲几乎战无不胜,连拿破仑一世和本杰明·富兰克林都成了它的手下败将。然而直到1857年,《国际象棋月刊》才揭露,其实傀儡里坐了一个象棋国手。

而电脑屏幕背后的人,又和机器里坐着的象棋国手有什么区别呢?而电脑屏幕背后的人,又和机器里坐着的象棋国手有什么区别呢?

  和专业人士合作

  众包模式固然有种种优点,但它的缺点也是致命的。

  当我向一位Google工程师朋友提起 MechanicalTurk的时候,他表示“我们不敢用 Turk标注”。

  因为众包模式,通过 MechanicalTurk标注的数据良莠不齐,花钱标注已经花了大功夫,整理和“清洗”数据又要浪费很多时间。尤其对于很多专业领域来说,普通人根本无法完成数据标注。

比如这种,你能告诉我哪个是有病变的吗?比如这种,你能告诉我哪个是有病变的吗?

  2017年,GoogleAI公布了一项突破性研究成果:通过机器学习技术,AI能够从病人的视网膜眼底照片中自动诊断出潜在的病变情况,来提前发现糖尿病性视网膜病变,进行及时的治疗和预防,让患者保住视力。

  但想要教会AI什么是正常的眼底照片,什么是有潜在病变的眼底,这个过程并不容易。

  为了获得高质量的标注图片,真正让AI的诊断水平达到执业医师的同等标准,Google与印度和美国的眼科医生合作,创建了含有12万张图像的开发数据集,再由3到7名眼科医生联合评估图片中的病变。

  最终,共计54名医生从这些视网膜眼底照片素材中标记出超过88万个确诊症状。这些图片和标记全部被用来训练深度卷积神经网络,最终使得AI的诊断准确率逼近甚至超越了医生。

  在GoogleBrain参与另一个与寿命预测相关的项目的工程师StevenZhan告诉我,他们的数据集标注工作基本无法众包,都是交给医生来完成的。

  虽然在未来,AI很有可能发展到“自己教自己”这一步。但目前为止,大部分的数据标注工作都是由真人完成的。这个工作不像大家想象的那么简单,而是充满了复杂的判定和繁琐的重复。

  而随着人们对数据的需求越来越高,也有越来越多的人开始靠标注数据为生。

  皮尤研究中心预测,这种零碎的数据标注工作将在未来几年内成为美国经济的重要组成部分。在2016年,有大约5%的美国人通过 MechanicalTurk这样的在线标注平台赚钱——这个数量已经超过了优步司机。

  在可见的未来里,人类还将继续为人工智能打工。

  在中国如此,在美国也一样。

推荐文章

爱数智慧客服对话标注规则范本及要求
登陆网址babel.magicdatatech.com/processmore/index.php用谷歌浏览器,鼠标拖动截取分段,内容右键,选择噪音符号  注意事项:1最开始可能有用户说的口令,“爱数智慧采集”,如果说口令的时候有其他说话内容叠加,那么直接标注口令。2不要断句太散,如果句子中有一个字听不懂的,请联系前后语境,推测出最可能的字,尽量整句标注)3如果数据本身有文字,那么文字之间的空格,不用删除,忽略。4系统提示音,类似“欢迎致电中国移动”,应该根据规范在文本前面加¥,正确的标注格式是:“¥欢迎致电中国移动”,因为这部分是机器音,所以忽略说话人编号。客服和用户分别用1,2标注。一、开始标注语音文件一 时间边界定位:• 用鼠标选中波形,即为要标注的一段时间边界,此时会自动跳出对应的编辑框 如果需要左右调动时间边界,则用鼠标放置在时间边界上,出现左右箭头后,按住鼠标拖动时间线,进行左右调动。图中的红蓝方框即为选中一段需要标注的时间边界。• 听音,在整段电话语音的基础上,根据语义和停顿时间等因素,在音频信号中每一句话的句首和句尾分别添加时间边界。即,一段标注框内,即为一段标注的话。• 不能有任何的说话人说话声、噪音没有被时间边界框住,即有声音的地方,都需要用时间边界框起来,然后标注相应的说话文本或符号,只有相对静音可以不做截取处理。 图示的地方,红框框住的地方有明显波形,有明显声音,却没有用时间边界框起来,这是不允许出现的错误。二 文件标注:• • 此处主要标注语音文件的一些全局信息,包括说话人性别信息和语种信息(方言区)。标注时请按照实际情况选择。• 关于说话人的选择,客服标注奇数,用户标注偶数;• 如果第三个人的情况:点击“+”号,即可添加。• 编辑框内需要标注的是该句对应的文字[文本层,需要根据语意打中文标点(逗号,问号,句号,顿号,感叹号)],如果是汉语交谈,则只能用简体汉字。对于语音中的数字部分需根据发音情况转换为对应的汉字,例如“27”→“二十七”;“我的电话是2381832”→“我的电话是二三八幺八三二(与发音相同)”。 • 编辑框内正常语音的标注• 如果此语段为某一个人的汉语对话语音,请在标注时间边界后,选择对应的1或者2,编辑框内输入相应的文本。• 如果此语段为两个人交叉语音,关于重叠(交叉)的语音,即对于某个人的一句话未完,另一个人的一句话已经开始的情况:请在波形上标注时间边界,编辑框内标注“+”(在编辑框内点击右键即可出现)对于叠加,必须是真实的。不能将大段的听不清语音和叠加混在一起。叠加段内的非叠加部分,前后最多不得超过1个字。• 在整个语音中,需根据说话人的变换来增加时间边界(不同说话人分段标注)。• 如果同一说话人说话时间较长,则应根据其语义来增加时间边界,每个时间段的长度最多不能超过8s,但断句也不要太散太短。根据标注经验,每个自然语言段平均在5-6秒左右即可。• 单字或者两个字的叠加(如:好,嗯,行,好的),声音较小,不影响主要说话人内容,那么可以不标叠加,直接写主要说话人的内容就行了。  • 英文:(英文都是小写)【单词】对于语音中简单的英文单词,在能听懂的情况下,直接标出即可。例如:“网址是三w点sina点com”;“二三八幺八三二at qq点com”(不要写这个@)“请以井号键结束”;(不要写这个#) 【字母】每个字母中间用空格隔开。例如:单词读音,g o o d则表示字母读音;例如:我的编号是f m s幺三二;• 语气词除了“诶”其他的语气词都是带口字旁的汉字标注。如果发音是表示应答的“嗯”,统一都用“嗯”,不要用“恩”或者“厄”。比如哦,啊,诶等.三 编辑框内噪音的标注噪音是指非说话人的突发的声音,所有此类标注都是中括号与语音内容的组合,¥是放在句首,其他的噪音符号都需要单独截取标注。1   听不懂的字,标注[*]• 听不清的长句• 方言• 大段的英文句子• 拿着话筒和其他人说话                            2    笑声:[LAUGH]。              3    由说话人发出的干扰浊音:[SONANT]• 咳嗽声• • 打喷嚏• 清嗓子              4    系统提示音,即系统播出的语音提示:¥系统自动播放的语音内容,而非说话人的语音内容(不用管说话人)例如:¥欢迎致电我公司现在由一号客服代表为您服务   5 明显的静音段(大于500ms)(一句话中没有超过0.5秒的不要断开,尽量完整完整,不要把已经完整的话段的太散!) 6  各种垃圾声音(大于500ms):[ENS]           1)  连续的拍桌子           2)     连续的敲击声        3)    持续的各种环境噪音    7  持续的音乐声:[MUSIC]• 唱歌声(有歌词和旋律)• 哼唱(没有歌词,但有旋律)• 口哨声• 可能是别人唱歌、演奏,也可能是背景的电视、收音机发出的音乐和歌声• 口哨声• 包括持续时间较长的彩铃声  8   录音及电信系统引起的噪声:[SYSTEM]包括电话按键音dtmf、电话忙音 beap、录音系统的其他噪音等,都是通信系统主动发出的声音,而不是摘机、挂机或干扰带来的咔啦或呲呲杂音。一般会用的噪音符号:+,[*],[ENS],[SONANT],[LAUGH],[MUSIC] ,¥,[SYSTEM]所有的噪音符号,在编辑框内右键即可出现哦 标注10分钟请点击一次临时保存,并刷新网页!     易错归纳:1 爱数语音智慧采集,这个是用户说的,说话人是偶数;2 “¥为保证通话质量有录音,尽情谅解”等的系统播报音,因为是机器音,所以不用管说话人(只要是系统播报音都不用管说话人,平台默认是说话人1);3 客服标注奇数,用户标注偶数系统提示音不用管,(1说话人标注反的很多;2 同一个客服,一会儿是1,一会儿又是3的问题);4 过于短暂的截取(像这种处理方式:把16段和17段合并,然后标注“嗯”即可!); 5 听错的情况,多前后联系,根据语音标注,而不是标注同音字;6 叠加:叠加的没有单独截取出来处理;7 不同说话人截取在一起标注内容的错误;8 规范里面颜色特别说明的标点符号,没有标注(标点符号基本没有看到有人标注的);9 数据没有标注完毕提交上来了;10A文字中可以加适当的标点符号,句尾不需要加标点符号。10 B标注的数据,A质检,验收发现,质检只是过了一个形式,没有实际作用,没有质量把关;11 返修的数据都有反馈意见,请全部检查修改!12 此项目含有标注信息,请在此基础上修改。 问题1:在客服与客户音频中,爱数智慧语音采集这句口令,如果出现在句首那么录音人应该标注1 还是 2?客服标1客户标2 问题2:爱数智慧语音采集这句口令如果与别的语音叠加了,怎么办?直接标:爱数智慧语音采集 问题3:接近直线或者接近静音的噪音要不要标注?不需要 问题4:叠加是否需要单独操作???如果:客服说, 你好有什么需要帮助。客户说了一句,你好,这个你好与客服的帮助叠加了,声音大小差不多,具体应该怎么办?单独截取,标+ 问题5:系统的智能语音怎么标注,请详细说明?句首标¥把系统音转写成文字 问题6:客服应该标注录音人几,客户标注录音人几,系统声音标注几。客服1客户标2,系统音标1问题7:如果客服说 爱数智慧,后面是5秒的系统声音,第六秒客户说语音采集正好与第六秒的系统声音叠加,应该怎么处理?先转写客服说的爱数智慧,再把系统音截取出来前面加¥把文字转写出来,叠加单独截取出来标语音采集,如果是其它内容叠加标+

热门文章

滴滴语音标注规则要求及视频教程
一、标注环境1. 请使用谷歌浏览器进行标注。2.标注平台地址:http://label.xiaojukeji.com/labelerTaskList二、标注内容1. 语音有效性标注无效语音请在有效性一项选择“无效”,并在标注文本一项标注大写字母“NULL”。有效语音请在有效性一项选择“有效”。当语音出现下列任意一种情况,即可标注为无效语音:1) 说话人声音极小,小到几乎听不到。2) 整段语音均为静音。3) 整段语音均为噪声、音乐声、导航音、广播等。4) 整段语音只有一个字,或是同一个字重复出现。如:“嗯”、“对”、“对对对对”、“啊”、“喂”、“拜拜”、“谢谢”、“好好好”、“OKOK”等。(注意:“哇噻”属于特例,单独出现时也是无效的。)5) 背景噪声大于说话人声音,或噪声与说话人声音几乎一样大。6) 整句都是方言、外语。方言是指发音与普通话区别较大的地方话,如:粤语、上海话等。7) 语音中出现地点、地名、街道名等方位词,但是地图中搜索不到。8) 语音中有大于等于两个人说话,除主说话人以外,其余人的声音清晰可辨。9) 语音中有大于等于3个字听不清楚。 2. 语音文本标注1) 语音文本内容将说话内容写成文字。要求转写的文本内容必须和听到的语音完全一致,不能多字、少字。a) 除空格、占位符号、以外,标注文本不允许使用标点符号,不允许换行。b) 说话人犹豫、口吃导致出现重复的字也要标注出来,重复了几次就标记几个。如发音为:我是北北京人;“北”字有重复现象。转写文本应为:我是北北京人c) 儿化音不需要标注出“儿”字。如发音为:我在/zher4/。转写文本应为:我在这d) 语音中提及地名、街道名、车牌号等内容,转写时需符合日常习惯。选用“路”、“街道”、“门”、“座”、“桥”等地名常用字以及“京”、“津”、“冀”等车牌号常用字。e) 语音中提及地名、街道名、店铺名、专有名词,需要准确转写。可根据读音在地图中查找,确实存在该地点则进行准确标注,搜不到则无效;f) 语音中确实听不清楚的个别单字,用占位符号【~】标记。一组【~】符号代表一个字。在整段语音中,最多只能有两组【~】符号。若有三个字或更多听不清楚,则标注为无效。(见“语音有效性标注”第8条)g) 语音中不涉及地名、专名的部分,若发音清晰但文字不确定,可以用同音字标注,要求标注用字的声韵调与实际发音完全一致。如发音为:我姓/zhang1/。标注成“我姓张”或“我姓章”都算正确。h) 数字要写成汉字形式,注意区分“一”和“幺”、“二”和“两”,按实际读音写。i) 英文字母要转写成大写字母。j) 音频中说话人清楚说出的语气词,如“呃、啊、嗯、哦、唉、呐、呢”等,要按照正确发音进行转写。语气词除了“了、不”没有口字旁,其他基本上都有口字旁。注意:语气词“唉”、“诶”不分的,统一用“唉”。 3.语言情况标注1)语音中全部内容均为中文,请选择“中文”。2)只要语音中含有英文,不论是单个字母还是单词、不论出现的数量有多少,都需要选择“英文”并且字母全部大写。1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于OK这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的及时与我们沟通 4. 说话人性别标注按说话人的音色实际情况进行标注。若无法明确区分男女,不论是成人还是儿童,都标注为“女”。三、标注常见问题总结1. 短句如何判断有效性?答:短句只要有大于或等于两个不重复的音节,即为有效。例如“嗯好的”、“明白”、“可以”等。 2. 有明显口音,但能听懂,需要标注吗?答:口音但不影响理解的,音频中个别几个字的方言可以使用同音字标注。听不清音节的方言也无法使用同音字标注的,可以使用【~】,大于或等于三个字需使用【~】符号的情况下。参照“语音有效性标注”第8条规则,标记为无效。 3. 标注时有的口音能听懂,是按听的音来标注还是按普通话来标注,标注需要符合现实逻辑吗?答:一般情况下口音按实际发音来标注。以下情况请特别处理:常用词语和专有名词需按现实逻辑标注(如:发音是“现/xian4/生”标为“先生”,“滴滴专/ce1/”标为“滴滴专车”等等) 5. 音频中一串数字如【12531】转写为一二五三一还是吆二五三吆?答:转写的文本要和语音实际读法完全一致。若读为yi1,则写一;读为yao1,则写幺。同理,“二”、“两”、“俩”;“三”、“仨”也需要区别使用。 6. 一段很短的音频中语速过快,有时候听起来像三个字又像两个,是不是都能判断合格?答:短音频且内容无法听清的情况下,标记为无效。长音频中很小的一部分,无法确定内容时,参照“语音文本内容”下f项、【~】符号使用规则进行。 7. 一段音频中语速过快,能听清某些音节但大多部分不能做出准确判断写不出是否可以判断无效?答:判断为无效 8. 一段音频中出现导航仪发出的声音或者只有导航仪的声音算噪音吗?答:整段只有导航音,标记为无效。只有一部分出现导航音的时候,看声音大小,如果与说话人音量接近或者大于说话人声音,标记为无效。 注意:如果一句话里面只说了几个字方言,其他都是带口音的普通话,不要直接标无效,那全方言的字按听到的音来标,比如:说的是上海话gege,就标成“葛个”,而不是标成“那个”。语气词无法转写的可以找同音字或相近音字转写;全方言无效 关于地点、地名、街道名等方位词,这些词我们需要使用地图搜索引擎搜索如果地点、地名、街道名等词语很长且词发音很清晰,但使用地图搜索引擎搜索不到这个地点。即使这句话其他部分可以完整的转写出来,但依旧视为无效。二、关于英文转写原规范为:英文字母要转写成大写字母。        细化:1、遇到英文单词和英文字母都需要用英文大写形式表现。例如:SORRY SORRY我现在在阜成路麻烦你掉个头2、单词与单词之间加空格 。例如:我把我的APPLE SEVEN PLUS落在了车上麻烦师傅还给我一下3、字母与字母之间加空格。例如:我下了好几回这个A P P了但是怎么安装都是失败的请问客服我该怎么办4、英文单词或者英文字母与汉字之间不需要空格。例如:我的车牌号的京A三六七八5、特殊字:对于 OK 这一类常用词,默认为一个单词,尽管是拼读成字母发音的。对于无从适配上述规则的,我们及时向海瑞提出。三、噪音符号这部分,这部分依旧不用添加。 四、关于标普、方普、方言如何转写    1、标普:就是普通话,我们是一定要转写的。    2、方普:就是方言普通话,例如广州人说普通话,上海人说普通话,天津人说普通话等等,这些是需要转写的。只是他们在说普通话的时候会有一些口音。例如发音说:我现在湖南(fu2声 lan2声)长沙市中心你来接我一下     他说的是“fu lan”我们正常书写成“湖南”即可。    3、方言:直接视为无效即可,例如:粤语、上海话、江苏话等等。