通用语音数据标注规则


2、标注规范 ——3项(文本、无效、性别)

 

 注: 文本正确率:95%     其它(无效+性别)正确率:95%

 

注:一定不要多字、漏字!!

2.1性别

类别

分类

定义

性别

童声

童声指小孩非常稚嫩的声音,大概是在5岁以下的范围。大孩子的声音归到男女。

其他

没有人声,或者男女混声的统一规为其他

 

注:女生之间的对话性别是女,男生同理;只有男女相混的对话是其他

2.2判断是否为无效语音

无效:

1、主体人声音的前面、或后面、或中间:有一段安静或噪声等非人声 ,长度在2秒以上(宽条是0.3秒)。

【注意整句无人声的不是无效】

2、声音是转格式转错的。

无效语音,直接打勾,文本不用修改。

3.全英文的句子听不懂标无效

有效:其它都是有效

 

2.3修改文本

标注文本,目的是耳朵听到“普通话或带口音的普通话”标成普通话文本,严重听不懂“方言”,可标注#

2.3.1标注#的情况

(1)听不懂、听不清的词或方言标注#

(2)英语语句中,听懂的单词标注出来,听不懂的标注#

3)除英语外其他国语言#,发音如“萨瓦迪卡”,“阿尼哈塞呦”等必须标#

4)粤语标注#

5)噪音标注#

6)遇到拼音标注#,如“阿啵呲嘚”等拼音

7)整句无人声,只有噪音,不超过2S的标#,如一个人整句咳嗽声

 

注:

#可以代表一个字不清楚或者几个字不清楚;

一句话中可以出现最多两个#,但不能 同时  ##  这种形式出现;

最多可以 #文本# 这种形式出现;

2.3.2姓名问题

(1)姓:必须标注正确,确定是有这个姓

2)名字:名字可以打同音字

 

2.3.3地名问题

(1)省市等较大地名必须查清楚,不能出现错字:如浙江省无锡宜兴市

 

2)较小的地名,如村镇以及道路、小区等可标注同音字。

 

2.3.4数字问题

1)听到的阿拉伯数字写成汉字,如“一二三四五”或“幺二三四五”

 

2.3.5儿化音问题

(1)带儿话音的,可以写出“”字,并且加括号;或者直接不打儿化音,皆可
例如:我得了5分儿,文本要写成:我得了五分(儿)/我得了五分


注意:不是儿化的不用加,如女儿,婴儿等不是儿话,就不能加在“儿”字上加括号。

 

2.3.6语气词问题

(1)注意口语的字口语中,结结巴巴说出的,要写出对应接接巴巴声音的字。

 

(2)口语中,“嗯”、“哦”、“啊””等,要准确对应文本。例:声音“呀”,不能写成:“啊”

 

2.3.7英语相关问题

(1)单词:英语单词,整个单词要小写。如“happy

 

(2)字母:说字母的写成字母,要写成大写。如“A  B  C  ”。注意:QQ、MSN,是字母发音,要写成大写。

 

注:英文单词发的不标准,如能听出是哪个单词,就写单词。

整句都是英文句子的情况:

一句话中发音不清楚的单词,标#,发音清楚的单词必须写出单词

整句英文都听不清楚时,标为无效,不要整句标为#。

英文用中文谐音写出来的,算错。如:black 写成 布莱克 算错

一些地名,人名按英文读的,需要写英文,如:I am gonging to shanghai  不能写成“上海”

其他国语言,发音如“萨瓦迪卡”,“阿尼哈塞呦”等必须标#

 

 

2.3.8混音问题

混音包括3类:

1、当前电话通话的两个人同时说话,相混

2、当前人声与较亮或尖锐的音乐声(如铃声、汽车喇叭)相混

 

混音部分的标注方法:

1)如果非主体人插话不影响对主体人说话的理解,标注员可以听出主体人说话的字,则要求写字。(不要出现一个音对应两个字)

例如:非主体人插入的话,音量小、字数少,可忽略当成没听见。

 

2)如果非主体人插话,造成标注员已听不出主体人混音部分的字,则要求混音部分标#

 例如:非主体人插入的话,由于音量过大相混在一起,听不清主体的话,混的部分写#

 

3)如果音乐声相混,不影响对主体人说话的理解,标注员可以听出主体人说话的字,则要求写字。

如果音乐声相混,造成标注员已听不出主体人混音部分的字,则要求混音部分标#

3:增加#的情况

人声中出现突然间的大噪音且与人声不相混,包括铃声、叮声、咳嗽、扑话筒、有大的音乐背景等,写1个#。

人声前边或后面出现一片乱乱的小声说话、持续的背景噪音,写#和不写#都可以。

注意:安静的静音处,不能写#。

 

 

2.3.9 标注页面蓝条与黄条使用

 

蓝条和黄条的功能有3个

1尺子,表示0.3秒,可以用于量取2秒判断无效。

2选中功能。选中的是播放蓝条最左端到黄条最右端的声音。当语速特别快时,建议分段选中去听,写下文本,正确率会提高。

3确定#在哪儿出现。

 

 

 

标准普通话与带口音的普通话对照表:

类别

定义

特例

举例说明

无口音

拼音、声调都正确

轻口音

拼音对,声调不对

n和l不分;

n和ng不分;

z/c/s和zh/ch/sh不分

属于轻口音

那个,发音:la4 ge5(标准na4 ge5 )

电信,发音:dian4 xing4(标准dian4 xin4)

平时,发音:pin2 shi2(标准ping2 shi2)

政治,发音:zeng4 zi4(标准zheng4 zhi4)

刚才,发音:gang1 chai2(标准gang1 cai2)

重口音

拼音不对

(n和l不分;n和ng不分;z/c/s和zh/ch/sh不分)除外

湖南,发音是 fu2 nan2(标准hu2 nan2)

歌曲,发音是guo1 qu3(标准ge1 qu3)

 

推荐文章

教育的本质是为了培养未来的人才。人工智能社会即将到来,我们如何应对?7月13日上午,编程猫联合创始人、CEO李天驰来到2019 钛媒体 T-EDGE 科技生活节,他认为,未来30年是人工智能推动的社会,会带动新的人才的需求。人工智能切到教育的细分教育场景的要素是编程,这会倒逼编程教育作为学科教育的发展。经过四年的探索,李天驰发现,我们很早就谈计算机要从娃娃抓起,但效果并不尽如人意,核心就是缺乏合适的工具。其次,现在的编程课程的设置大多不是基于孩子的现年龄段的知识储备而设计。同时,因为编程教育的发展时间较短,相关师资人才匮乏。“有些工夫省不了的,教育本质上像传统农耕业,你必须仔细照顾这些幼苗,仔细为他们除草、施肥、耕作才会发芽。”李天驰说。好工具、好课程和好教师是才是关键。因此,我们要开发出更适合少儿使用的编程工具,根据不同年龄阶段的特点来设置课程,让编程教师有更多机会得到更好的收入,这样才能从根本上促进编程教育的发展。(本文首发钛媒体,作者/李程程)以下是编程猫联合创始&CEO李天驰在2019 钛媒体 T-EDGE 科技生活节演讲全文,经钛媒体编辑:大家好,很高兴来到钛媒体峰会。我在小学二年级学习编程,后面做计算机相关学习和研究,等到2015年,世界范围内少儿编程这个趋势非常好,回到中国来做,创办编程猫,一共四年,累计下来编程猫上面有一千多万学生学习编程,进到一万多所学校里,今天通过编程教育我们也连续八个季度收入翻番,预计下半年实现盈利。那么编程给我们孩子带来什么样的未来呢?先从几个小故事跟大家做分享。第一个是家在南方孩子叫丙南。之前有一个非常著名的媒体给他做采访,为什么采访他呢?一开始,他们采访编程猫的时候问我们,你们的孩子都是哪里的孩子,是不是家庭背景高大上?我说,分布非常不均匀,怎么样的背景都有,比如说丙南,家里是小区楼下小卖部,是一个旧货店,家里卖货的时候有一个小电脑,他用那个小电脑完成编程学习。2017年的时候,他的妈妈不是很理解,他举例说编程以后会像普通话一样的普遍,这是他们的理解。第二个故事是一个深圳小朋友——王蓉。她2016年开始学习编程,是五年级的学生,今天初一了。前不久,她妈妈特别开心跟我分享他孩子的变化,因为我们看到他在论坛上发布的贴子,跟我们平台上其他小朋友一起做一些探讨。这个孩子因为学习编程开始自己探索数学问题,因为他在研究一些课题的时候受到了阻碍,因为编程不仅仅是编程本身,也需要做课题的时候,需要很多其他学科知识,他自己花了一年的时间来去学习各种各样的知识,然后在知识帮助下完成AI学习的作品。在学习过程当中,他妈妈为什么找我聊天呢?特别有意思,在整个过程当中他没有参与其他任何补课,但是在这样过程里面通过自己的探索,在深圳名校里面,从年级中等的学生变成了年级前十的学生,这是他自己学习变成的变化。第三个故事是一位佛山的老师,后来他去到四川大凉山支教,写了他自己在支教过程当中的感想,我们把编程教材寄到大凉山的时候,他发给孩子,教大凉山的孩子学编程的场景。这个老师说,他选用编程猫作为教学工具原因是什么,以及在教学过程当中遇到什么困难和喜悦跟我们进行分享。这三个故事在不同时间节点发生,2015年到2019年,很多人重视编程教育,为什么它会越来越被重视呢?大家从政策上已经看见。我们出台各种各样的政策。原来教育部通过29项比赛,更多以学科为主,但是到今年,这29项比赛里面几乎1/3跟科技创新、编程类相关。我一直认为,教育本质是为了培养未来的人才,教育跟国家未来紧密相关,也是跟社会未来紧密相关的,教育要培养什么样的人才呢?过去30年和未来30年社会在发生什么样的变化?过去20、30年间,整个社会推动力量主要是互联网的变化,从互联网的兴起、带宽从有线变成无线,变成2G、3G、4G到今天的5G,互联网和移动互联网构成社会发展推动重要力量。从2020年到2030年、2040年我们社会经历新一轮技术对社会的推动,就是人工智能。社会由人工智能推动产生,因为人工智能技术发展会逐步推动社会发展,所以社会对新的人才产生新的需求。人工智能为什么倒逼编程这样一个学科发展?我们自己在内部举例的时候经常拿另一个学科举例,就是英语。从1978年改革开放以后,2001年加入WTO一直到现在,经济全球化是过去那个时代生产力发展最重要的因素,经济全球化带来了对全球化人才的需求,人才化的需求带来了教育改革,教育改革不断深化从大学到中学到小学,我们看见英语作为一个学科不断从高往低渗透到现在到幼儿园。还有很多人问我,为什么人工智能人才倒推在编程里,为什么不让小孩子进行机器学习,学习人工智能相关的知识?除了不一定学会以外,经济全球化以后,带来并不是这些孩子就要学全球化的这个学科,全球化的人才是一个很笼统的概念,切分到教育的里边,你会看到全球化基础要素工具是什么?是英语,走进教育是英语,而不是全球市场,或者说全球化商务这种学科。人工智能也是一样,它切分在教育垂直场景里面,要素是什么?是编程。我们在大学里面有这些动作,增设了人工智能学院,开了很多大数据专业。在中小学从去年开始密集有政策出来,开设编程课程,我们自己也参与在其中,我们进去非常多的学校,跟部里和各省厅有相关合作,在各地开展信息技术和编程教材。如果社会上对人才有需求的话,我们的孩子需要什么样的编程教育呢?这四年来的探索总结三点:好工具、好课程、好老师。编程在计算机基础上发展,计算机从机器语言到汇编语言到高级语言到今天,我们国家从80年代有计算机普及的推广,邓小平说过计算机要从娃娃抓起,从2017年以前回顾的话,你会发现为什么效果不好,核心就是缺乏合适的工具。因为孩子学习和成人学习不一样,第一有足够趣味性,第二以孩子思维培养为基础。编程猫做了Kitten个硬化工具,为什么更适合孩子呢?在这里面除了非常易用以外,功能非常多也很强大,它只要搭一些积木可以做一些神经网络训练的东西,包括像云计算等等东西。它的功能会更好。Kitten和其他工具相比的话,它在跟真正C语言、Python底层上是连通的,我们做它的方式和其他的工具,有一些不太一样的实现方式,本质上在高级语言上面做一层封装。所以,在学习过程里面从一个三岁的孩子学高度封装化图形方式,到中小学阶段从Kitten完成中小学学习,其实这里面是无缝连接,成体系是最重要的。什么是好课程?大部分孩子在上编程课,有很多实际上都不是非常好的设置。现在很多人在做编程课程是什么样的?在设计的时候我们叫面团设计,设计的课程的时候用户就是一个面团,你想捏成什么样就捏成什么样,有时候课程为一个七岁孩子设计的,有时候变成高一的孩子,当应用在教学里面及其难教,对于孩子来说怎么学都学不明白。如果这个课程为一个中学孩子设计的,一定会把乘法、除法考虑在里面,默认已经懂,小数点、百分比都不是问题,这个时候你做的课例难度已经在那里了,7岁的孩子怎么明白呢?你把坐标改成7.9和-1、-2,不同年龄不同认知特点的孩子要求课程不一样。现在大部分机构也好还有一些人员也好是凭着自己的想法去根据面团一样的用户去设计这个课程,对于用户来说是非常不友好的,而且对于孩子来说是在浪费时间。必须根据孩子不同年龄特点设计不同的课程。为什么大家不这么干呢?大家知道,依据不同的特点去设计不同的课程只有一个结果,课程量会大大增加,设计人员、课程体系要求会大大增加,而且是平方级的增加,为什么做矩阵式的课程呢?有些工夫省不了的,教育本质上像传统农耕业,你必须仔细照顾这些幼苗,仔细为他们除草、施肥、耕作才会发芽。编程课必须分年级,如果不分年级会发生为面团设计课程的事情,这对用户来说是极大的浪费时间。拥有这样认知特点的孩子,就应该匹配这样认知特点的课时,这是我们的观念。现在很多人在研究编程课程的时候,我们觉得在严谨性上还是有一些欠缺。编程课的研发必须是严谨和科学的,现在很像我家小孩病了,我旁边没有什么好的医生,更好我认识我家旁边有一个孩子,刚刚学完兽医毕业,我让他给我这个孩子看看,就像这样一个情况。因为编程教育的发展历史非常短,所以相关人才匮乏,大部分人做这个事情的时候凭拍脑袋,凭自己的想法,向中医开一些处方一样未必有良好的依据,这是我们自己做的尝试。希望通过自己的举措带动业界的进步,把这个课程落到学校里面,让更多的相关专业老师、学生、领导全方面来进行课程的科学性的论证。另外一个点,倒不是必备项目,一个好的课程对于孩子本身来说会有一个比较好的发展,编程课程最好学科融合,能够跟数学、语文、英语有一些关联,在你设计课例的时候,让这个孩子不仅仅在编程垂直领域去做,你在做项目的时候用编程知识解决生活问题,本质上编程教育解决问题的能力。比如说,让他用爬虫处理一下看看古代诗人互相之间的关系是什么,了解一下各个诗歌之间互相引用对方名字的频次……包括像数学方面的结合更多了,做出英语的单词听写器,每次自己在家完成听写作业,不用家长帮助孩子解决作业的问题。我们觉得学科融合是一个特别好的概念,我们也把它引入到我们课程里面去。对于编程教育来说,什么是好老师,这里有一个误区,程序员是不是适合教孩子编程?因为程序员自己编程水平会好,但是他对儿童发展、对于孩子的教育实际上有他自己一定缺陷在这里。我曾经教过一个孩子,他爸爸是一个很厉害的程序员,他问我说,你一直让这个孩子把这个角色在这里重复动,不考虑内存回收问题吗?这个习惯培养这么不好,将来怎么办。其实,你从孩子本身的特点来说,7、8岁的时候未必就是需要考虑那么周全,它的逻辑还没有到那个地步,所以编程老师有一个难点,既要懂编程和计算机科学,又要懂教育和儿童发展心理学。这样的老师怎么来呢?我们自己总结,一方面你需要有梦想和情怀改变这个世界,带给下一代有意义的事情,另外一方面必须匹配很好的收入,否则他们去阿里和腾讯了。我们经常开玩笑,一流的程序员可能当程序员,二流程序员都当产品经理,当不了产品经理才能考虑教育,总是三流肯定不好。一定有很好的收入去匹配,很好的收入背后是什么呢?编程教育要由什么样的老师,由编程教育商业闭环决定的,好的商业闭环带给好的老师,不好的商业闭环下机构的老师肯定不会太好,因为上限在这里,好的人往其他行业溢出。往外说是AI教学系统,实际上是人机交互教学系统。我们认为一对一的模式,或者其他的模式是不能带给老师很好的收入,必须用技术让老师提效,让收益增加才有可能。到今天为止看到,一个好的老师在一个月拿到5、6万的收入,在这个前提下才会有好的老师和人才愿意往这个行业里面来,好的商业模式支撑老师创造的收入是合理的,支撑企业正常发展,从500个老师到1000个老师,到2000个老师和1万个老师是没有办法负载的。很多人问我,你们为什么搞这套东西,我们想给老师创造更高收入,让更好的人才进入到这个行业里面来,真正意义上解决好老师的问题。这是我们那套系统的视频,在重庆8所学校许老师拍的。这是在课堂里面50多个学生上着50多个种进度课程的案例,这是一个课程在脱离老师以后进入到公益校的尝试。和很多高校合作培养编程教育的人才。

热门文章

波士顿 - Neurala公司今天推出了一款新的视频标注工具,该工具由Brain Builder平台的人工智能辅助。“自动视频注释将显着加速神经网络的数据标注,从而帮助组织更快地培训和部署AI,”该公司表示。标记图像和视频对于开发用于建模和训练AI应用程序的数据集至关重要。Neurala  以软件即服务(SaaS)为基础提供Brain Builder,以帮助简化深度学习的创建,分析和管理。Neurala的联合创始人兼首席执行官Massimiliano Versace说:“人工智能数据准备的传统方法极其耗时且耗费人力,需要大量数据,需要经过精心和昂贵的注释。” “我们与Brain Builder的目标是通过易于使用的注释工具降低进入门槛。通过添加视频注释,我们能够进一步自动化数据准备,帮助组织将AI数据准备的时间和成本降低至少50%。“Neurala的专利和获奖技术源于2006年NASA,DARPA和空军研究实验室的神经网络研究。2013年,该公司加入了Techstars商业化计划。“每个人都想要AI,但他们不知道为什么,”Neurala的联合创始人兼首席运营官Heather Ames Versace说。“视频注释工具是终身AI技术堆栈的一部分,可提供透明度。”启用AI的注释可节省时间,提高工作效率当用户标记视频中的人物,物体或缺陷时,Neurala的新工具可以反复学习。Neurala表示,在用户在第一帧中标记感兴趣的项目后,该工具会自动在后续帧中注释相同的项目。例如,如果五个人输入一个框架,则在用户仅用一个人标记第一个框架后,它们将全部自动注释。相比之下,用户必须在他或她进入框架时标记每个人,这将花费更多的时间。此外,AI辅助视频注释可以提高标签处理速度并提高生产力,Heather Ames Versace告诉“ 机器人商业评论”。例如,用户可以注释10秒视频的一帧并获得300个注释的输出,而使用传统的注释方法,用户需要手动标记300个不同的图像才能获得相同的结果,Neurala说。“可解释性和信任始于数据,”Heather Ames Versace在最近的AI World大会上说。“通过在更短的时间内对数据进行注释和标记,团队可以进行更快速的原型设计。”用Brain Builder存钱“最终,它将帮助组织和开发人员更有效,更具成本效益地构建,培训和部署人工智能,”Massimiliano Versace说。“当涉及视觉AI的构建方式时,Neurala的Brain Builder平台已经在改变游戏规则。而现在,视频注释将进一步扩大可访问性和生产力的可能性。“Neurala说,Brain Builder还可以提供可观的投资回报。使用Brain Builder,组织可以以每小时6,750美元的视频进行注释,而没有它的则为13,500美元。Neurala发布  了一个教程  ,概述了使用Brain Builder在视频中标记对象的过程和好处。它还解释了如何使用TensorFlow训练语义分段网络。此外,本教程还引导观众了解跨多个GPU的培训步骤,这可以进一步缩短培训时间。