介绍下数据标注平台的运营模式

    目前AI行业发展火热各大巨头都投入巨资在此领域布局,智能驾驶、人脸识

别以及近段时间正火的AI养猪都是AI技术应用在实际生活上的体现,毫不夸张的说AI

技术正在逐渐改变我们的生活而我们的生活也将因此变得更美好。

     AI的发展离不开数据标注的支持,而目前AI行业庞大的数据标注工作都 是通过 哪

种模式完成的呢?

    

一、常见的数据标注平台

由于数据标注的重要性和高质量标注好数据的稀缺性在催生了一大批专职做数据标注团队的同时也催生了一批数据标注平台,比较有名的有百度众测、京东众智、龙猫数据、数据堂等。众所周知百度在互联网大厂是最早开始且投入巨资研Ai 技术的,所以百度众测平台的任务大部分都是百度内部的需求,他们也会接受其他AI公司的数据需求,但是在数据量和价格上会有限制。相比百度而言其他几家数据标注平台就比较亲民一些了,中小型的AI公司的需求一般都会接受。为什么这个地方没有提到大型AI公司呢?那是因为大型AI公司一般都会自建平台且有专门的数据标注团队负责公司的数据需求。

二、数据标注平台的业务模式

(1)众包模式:
现在数据标注通常采取众包的模式,众包模式的优点就是成本较低响应较快。这种模式适用较简单的项目如点点拉框等项目。发布者往往将任务详细介绍和题目一同发送到平台上供广大数据标注兼职人员作答。但众包模式有一个很明显的问题就是质量较难把控,因为众包模式是面向大众的你并不知道在给你做标注的是什么人,他们可能是厨师,是全职太太,是老师每个人对规则的理解不尽相同且不可避免的会有一部分对任务乱答一通影响项目质量。为此各平台也会使用一些方式减少问题的产生提高项目质量。比如增加改判环节一道题在答完之后会由他人进行改判如若判错则不获得任务报酬,此外为防止错判维护答题人员利益还会设置申诉环节使答题人员对有疑问的题目进行申诉。设置标注人员级别,标注人员任务正确率较高答题数较多则能慢慢提高等级解锁更多任务获得更多的任务报酬且有机会进入改判环节成为改判员。
(2)外包模式
外包模式与众包模式相对是将任务外包给专门的数据标注公司和团队,在项目一开始会对项目整体进行评估然后针对项目整体进行报价由数据标注公司自行安排培训安排人手,只需要保证在项目截止日期前保质保量交付数据即可。这种模式的优势就是数据质量和项目周期有保证。但是响应速度较慢成本较高,因为一开始需要安排竞标且平台需要安排专门的项目人员进行项目对接和项目跟进。现如今国内专门做数据标注的团队较多,但是大多数只是以工作室和几十人的小团队为主且业务类型集中在简单的拉框图像标注上。也有一些的较大型的公司如贵州的梦动科技已经形成产业化带动了当地的发展。又或者是“点我科技”他们自建有平台可以自研工具同时担任着数据标注平台和数据标注公司两种角色。
基于以上两种业务模式的答题模式:
A模式:A模式指只进行一次答题模式,后续没有改判操作。这种模式应用较少主要用于较简单正确率要求不高的项目。
AC模式:AC模式指在答题完成后会有一个改判流程,改判员只能对题目进行正误的判断不能在答题的基础上进行操作。
ACC模式:ACC模式和AC模式的主要区别是AC模式不能够之前的答题情况作出更改,而ACC可以更改。


三、制约数据标注平台发展的因素

  1. 业务模式
    一个好的业务模式能不断拔高一个平台的业务上限,上面介绍的两种常见的业务模式(众包模式和外包模式)因为他们都有各自的优缺点,所以单一的使用任何一种业务模式都是不可行的。单存使用众包模式会带来项目质量难以把控,风险高的问题,且众包模式只适合承接比较简单的需求。单一使用外包模式则会造成对数据标注团队的过度依赖,降低整个平台的活力,造成平台现有人力资源的浪费。
    对此我们需要两种模式兼用初期需要投入一定的资源建立自已平台的众包团队,这个人数一定要多只有这样才能保证有足够的活跃人数能够完成数据标注任务,同时还要一直有众包任务才能保证这些人一直活跃。众包团队建立起来之后我们就可以将简单的任务通过众包模式发放出去,一些复杂专业性比较高的任务则通过外包模式发放出去即可。

  2. 数据标注团队
    一个数据标注平台必须要足够的数据标注团队才能承接更多的需求,为了增加平台上入驻的团队数量我们需要提高平台内部的活跃度同时平台上有足够的任务。每个标注团队往往都有擅长的业务类型,我们也需要根据不同团队的特点发放给他们不同的任务。

  3. 任务需求
    一个平台要想不断发展一定要有足够的任务,增加平台承接的任务则需要提高平台的知名度,提高平台的知名度可以通过广告投放,客户口碑传播,搜索优化等方式。同时还需要一个有力的商务团队。

timg (1)_meitu_2.jpg


参考原文地址:https://blog.51cto.com/14065470/2355532

推荐文章

汇数智能将致力于规范AI数据标注人才市场
人工智能行业内有这样一句话“有多少智能,就有多少人工”。当然这里的人工不是指生产流水线上的工人。这里的“人工”是指工作在人工智能最基础岗位上的小伙伴们。这个岗位是----数据标注、数据采集。我们知道人工智能的发展,得益于海量的数据采集和标注。机器是没有认知和记忆的。而数据采集和标注就相当于告诉了一个机器,这是什么东西,给机器的认知输入了“条件”。简单的说,如果你标注出错,那么人工智能也会出错。简单的说可能把梨子认识成苹果。在人工智能发展起步阶段,技术发展不成熟,在很多方面的要求都不太严格。比如说,在数据标注这块领域,前几年可能只要你有电脑,会操作就可以做。而且很多数据标注公司为了降低成本会找很多不专业的兼职来完成数据标注的工作。所以整个数据标注行业从业人员的要求、门槛是比较低的。当然这也直接导致了数据标注的质量是不高的。自2019年开始,越来越多的人工智能公司或项目,更加关注数据质量对AI智能的重要性和紧迫性,优质的数据才能有优质的智能结果,但是市场确认统一的专业课程及相关认证培训,人才市场一度混乱。一方面是人工智能公司找不到合适的专业的标注团队,另一方大量闲置人员又缺乏相关从业经验,人才供需结构矛盾越来越明显,造成AI公司对外包公司,外包公司对个人等相互之间的互不信任。为了解决这个问题,汇数从2019年初开始已经开始联合国内知名的人工智能公司及大厂,开始打造一套标准的且可持续的数据训练人才认证方案和体系,以规范现有的人才市场,为人工智能行业提供最专业的基础性人才大军。随着人工智能技术的发展,人工智能广泛的应用在生活、生产各个领域。人工智能对数据采集、数据标注有了更高、更专业、更精细化的要求。现在如果你还是一个只会操作电脑的计算机小白,那么你可能不适合数据标注这个岗位了。随着人工智能的发展,未来对数据采集、数据标注的质量要求会更高。那种粗制滥造的数据标注和采集,根本达不到AI行业发展的要求。所以,未来将有一大批不合格的数据标注员、数据采集员被这个行业无情的淘汰掉。数据采集、数据标注是人工智能领域中最基础的岗位,虽然是初级岗位但它及其重要。数据标注的质量会直接关系到人工智能项目是否能成功落地。目前人工智能行业发展迅速,行业内的专业人才稀缺。而目前数据标注岗位的人才职业化、专业化程度都是较低的,为了满足AI行业的发展要求,在未来对数据标注员、数据采集员进行认证就是趋势,只有达到专业的认证,掌握专业的技能,才能更好的完成数据采集、数据标注的任务。而这种专业至上的生存法则,才更能满足人工智能行业的发展的要求。

热门文章

简单讲:互联网数据标注员是借助电脑或者移动设备对一些原始的数据进行处理,生产出满足AI公司机器学习需要数据的一群人。按照数据处理对象的不同,工作内容也会有差别,标注员的工作内容可以分为:分类;框选;注释;标记。按照所处公司的不同,标注员的工作方式也会有差别:有的人工智能公司处于对数据安全性考虑会自建标注团队,在这些公司工作的标注员可以保证自己工作内容不会出现太大变动;但一些服务于人工智能公司非专业外包公司标注员的工作则是项目制的,一个项目忙完紧接着做另一个项目,这样工作内容连续性较差,对一种类型的项目经验也不会积累的太多。就目前来说,人工智能还处于人工增长阶段,机器依然需要大量的数据进行训练,测试。标注员在当下也会一直存在,而且从业群体会越来越多,所以暂时不用担心这份职业会不会短期消失。就标注员从业来说,建议选择人工智能公司和专业的数据公司,这样可以保证自己在一个方向上了解的足够深入。就职场晋升来说,以牛牛数据为例:标注员——项目经理——项目总监——数据运营总监。首先谈谈什么是数据标注。数据标注有许多类型,如分类、画框、注释、标记等等,我们会在下面详谈。要理解数据标注,得先理解AI其实是部分替代人的认知功能。回想一下我们是如何学习的,例如我们学习认识苹果,那么就需要有人拿着一个苹果到你面前告诉你,这是一个苹果。然后以后你遇到了苹果,你才知道这玩意儿叫做“苹果”。类比机器学习,我们要教他认识一个苹果,你直接给它一张苹果的图片,它是完全不知道这是个啥玩意的。我们得先有苹果的图片,上面标注着“苹果”两个字,然后机器通过学习了大量的图片中的特征,这时候再给机器任意一张苹果的图片,它就能认出来了。这边可以顺带提一下训练集和测试集的概念。训练集和测试集都是标注过的数据,还是以苹果为例子,假设我们有1000张标注着“苹果”的图片,那么我们可以拿900涨作为训练集,100张作为测试集。机器从900张苹果的图片中学习得到一个模型,然后我们将剩下的100张机器没有见过的图片去给它识别,然后我们就能够得到这个模型的准确率了。想想我们上学的时候,考试的内容总是不会和我们平时的作业一样,也只有这样才能测试出学习的真正效果,这样就不难理解为什么要划分一个测试集了。我们知道机器学习分为有监督学习和无监督学习。无监督学习的效果是不可控的,常常是被用来做探索性的实验。而在实际产品应用中,通常使用的是有监督学习。有监督的机器学习就需要有标注的数据来作为先验经验。在进行数据标注之前,我们首先要对数据进行清洗,得到符合我们要求的数据。数据的清洗包括去除无效的数据、整理成规整的格式等等。具体的数据要求可以和算法人员确认。二、常见的几种数据标注类型1.分类标注:分类标注,就是我们常见的打标签。一般是从既定的标签中选择数据对应的标签,是封闭集合。如下图,一张图就可以有很多分类/标签:成人、女、黄种人、长发等。对于文字,可以标注主语、谓语、宾语,名词动词等。<img src="https://pic2.zhimg.com/50/v2-df93dc0a7e8a5fe387dc3774748b5f05_hd.jpg" data-caption="" data-size="normal" data-rawwidth="700" data-rawheight="400" class="origin_image zh-lightbox-thumb" width="700" data-original="https://pic2.zhimg.com/v2-df93dc0a7e8a5fe387dc3774748b5f05_r.jpg">适用:文本、图像、语音、视频应用:脸龄识别,情绪识别,性别识别2.标框标注:机器视觉中的标框标注,很容易理解,就是框选要检测的对象。如人脸识别,首先要先把人脸的位置确定下来。行人识别,如下图。<img src="https://pic2.zhimg.com/50/v2-7824903d6d840e2bb08d96b5c2fa5874_hd.jpg" data-caption="" data-size="normal" data-rawwidth="591" data-rawheight="398" class="origin_image zh-lightbox-thumb" width="591" data-original="https://pic2.zhimg.com/v2-7824903d6d840e2bb08d96b5c2fa5874_r.jpg">适用:图像应用:人脸识别,物品识别3.区域标注:相比于标框标注,区域标注要求更加精确。边缘可以是柔性的。如自动驾驶中的道路识别。<img src="https://pic3.zhimg.com/50/v2-4bc1dd2278182acf94fc426d7e6f2dc1_hd.jpg" data-caption="" data-size="normal" data-rawwidth="601" data-rawheight="377" class="origin_image zh-lightbox-thumb" width="601" data-original="https://pic3.zhimg.com/v2-4bc1dd2278182acf94fc426d7e6f2dc1_r.jpg">适用:图像应用:自动驾驶4.描点标注:一些对于特征要求细致的应用中常常需要描点标注。人脸识别、骨骼识别等。<img src="https://pic4.zhimg.com/50/v2-5e24f394516c75e45942c37ba0da85c0_hd.jpg" data-caption="" data-size="normal" data-rawwidth="583" data-rawheight="387" class="origin_image zh-lightbox-thumb" width="583" data-original="https://pic4.zhimg.com/v2-5e24f394516c75e45942c37ba0da85c0_r.jpg">适用:图像应用:人脸识别、骨骼识别5.其他标注:标注的类型除了上面几种常见,还有很多个性化的。根据不同的需求则需要不同的标注。如自动摘要,就需要标注文章的主要观点,这时候的标注严格上就不属于上面的任何一种了。(或则你把它归为分类也是可以的,只是标注主要观点就没有这么客观的标准,如果是标注苹果估计大多数人标注的结果都差不多。)三、有什么发展前途?数据标注员可以说是AI消灭了一部分工作又创造出来的一种工作。在未来AI发展良好的前提下,数据的缺口一定是巨大的。可以预见3-5年内数据标注员的需求会一直存在。至于发展,其实所谓一些熟能生巧的工作,都是有被替代掉的风险的。深度学习解决的一件事情就是熟能生巧。在这个岗位上,其实你的一些想法就代表了AI的想法,AI会根据你标注的数据进行学习,想想还是有点成就感的。数据标注可以说是AI的入门级岗位,未来可转向其他AI岗位。如项目实施顾问等,这就要求更多的工作技能,需要再工作中积累。作者:跹尘链接:https://www.zhihu.com/question/30654399/answer/264828926来源:知乎著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。