知来藏往网

编辑|冷猫最近,有个很有意思的现象。在山西的一个小镇里,出现了一个让人印象很深的场景:村民们戴着 GoPro,正在为大厂采集具身智能的训练数据。在山东泰安,村民们在社区的居家场景采集点,录制叠衣服、打

对话际数科技联创:质量赛方式的先驱者,关键做空间数据的「精炼厂」|高效轮|算法|客户端节点_网易订阅

对话际数科技联创:质量赛方式的先驱者,关键做空间数据的「精炼厂」|高效轮|算法|客户端节点_网易订阅
编辑|冷猫最近,对话的精订阅有个很有意思的际数键做节点状况。在山西的科技空间一个小镇里,出现了一个让人印象很深的联创炼厂轮算场景:村民们戴着 GoPro,正在为大厂采集具身智能的质量者关训练数据。在山东泰安,赛方式的数据村民们在社区的先驱居家场景采集点,录制叠衣服、高效打扫卫生等家庭场景的法客视往往数据。「人类历史上规模最大的户端数据采集行动」已经拉开了帷幕。具身就像一次全新的网易工业革命,而数据则是对话的精订阅新兴智能时代的基础资源。各大具身智能赛方式的际数键做节点参与者都在向「现实世界」这座取之不尽的数据金矿中寻求原始的数据资源,甚至已经将数据采集卷入了「人民战争的科技空间汪洋大海」。模型、联创炼厂轮算算力、数据,是具身智能公认的三座大山。当越来越多的钱和人涌向「数据采集」时,按照全民参与的比例,实现一亿小时的人类数据采集,理比如上一年就够了。可这依旧无法顺应行业的需,「数据荒」甚至愈发严重。这中间的矛盾在哪?答案很便捷,但又很复杂:一切状况的题在于数据质量。采得多,不代表采得好。真正能喂进模型的数据,始终是稀缺品。这两年,把「数据质量」挂在嘴边的公司越来越多,可真正拿得出方式划、能在市场上跑通商业闭环的却寥寥无几。际数科技是其中少有的一个。它闯出来的一条路,恰恰是这条赛方式上的新范式。机器之心与际数科技的三位联合创始人开展了深度访谈,为这个「数据越多,但可用数据越少」的时代两难,找到了一个新答案,一条新馗。「这就好比,我们本来关键用互联网广袤的语言语料去训练大模型,让它涌现出智慧,」周源博士打了个比方,「结荚却请一堆中学生写命题作文,喂给模型。这两个成效,天差地别。」际数决定把质量判断本身做成模型,打造了优质空间智能数据基础模型,让数据在进入下游训练之前,就能被理解、研究和筛选。这也是他们区别于所有采集厂商、仿真厂商和具身厂商的地方。两个金字塔:颠覆性的质量观念周源博士用空间数据行业七年的经验告诉我们:真正能进入模型、对性能和泛化产生改进的数据,从来都是一个质量状况,数量在这里帮不上忙。当所有人都在数量的汪洋里往前冲时,际数科技却特别罕见地关注了一个几乎没什么人在意的地方:数据,是否可靠、是否可用、是否可验收、是否可复用。过去几年,它一直默默打磨技术、在客户需中积往往经验,做成了数据质量这个细分领域的头号玩家。我们一直认为,数据质量是一种「自上而下」的金字塔:数据工程的本质其实就是模型工程,是一件结荚导向的事。也就是说,质量是被结荚倒推出来的。评判数据质量好坏的最后原则,是模型的谝。模型谝好,就验明正身数据的谝没有状况。际数团队的世界观完全不一样,因为他们是一支测绘背景的团队。门方式在于,测绘关键处理的是空间数据的定位、空间关系的误差和选定性状况,它必须产出选定性极高、精度极高、误差极小的成果。因此测绘从一最初,就把数据当成一个误差状况、一个质量状况来对待。为什么这么偏执?因为测绘的成果频仍决定了建筑的稳固性,质量不能靠下游成效来评定。「对空间数据的处理,一定是在上游、在采集端和处理端就把质量状况消灭掉。」这是一种「自下而上」的世界观:不等下游动手,直接在数据端拦住质量状况,让下游拿到一个极度选定的数据集,性能、原则、质量都可评估、可见、可复用。CTO 叶文凯博士讲到,数据质量是一个共性状况,「如果是单一公司或个体来探究数据质量状况的分布,它所有车型、传感器配置、技术栈都特别相同,熵特别小,就很难泛化出对广泛质量状况的认知。」而这个状况只能由第三方来做。无比如是具身模型还是智驾模型,每家公司从数据素材到模型本体,频仍都有一套封闭、自洽的技术体系。数据质量并不从属于某一种本体。它所包含的状况与误差,天然跨越不一样模型、不一样硬件和不一样采取场景,因而具有高度的共通性。际数仅在智驾领域就已经服务过二十多家客户,广泛接触过不一样传感器组合和不一样技术路线中的数据状况。正是这种跨客户、跨系统、跨算法范式的实践积往往,让际数能够跳出单一方式划,识别数据质量背后的常用规律。越是封闭的单一玩家,越不可能真正处理质量这个通用状况。际数作为中立第三方,反而站在了最适用用的位置上。一个自上而下,一个自下而上,决定了际数和行业里其他玩家走上了两条完全不一样的路。一张图、一把尺、一个高效轮际数对数据质量有深刻的理解,三板斧处理状况:一张图、一把尺、一个高效轮。「一张图」用测绘技术建立了精准的空间数据,对哪些因素会对质量产生正负意义,做预测和评估;「一把尺」是际数的误差检测模型,精度更高、材料更完善的场景基座,研究一套观测体系在特定场景里会出现什么误差、哪些能修正;「一个高效轮」积往往的是不一样传感器、数据产品和交付场景中的质量状况与质检经验。专家判断被逐步转化为质量模型参数,用于守住最后交付质量。这些共同构建了际数科技在数据质量领域的技术护城河。从一颗火星石头,到一座质量因子库在访谈中我们得知,周源和叶文凯两位联创有一位共同的导师,空间材料领域大拿李荣兴教授。李荣兴是 NASA 火星探测漫游者任务的参与科学家,首先期从事行星制图与漫游者定位探究,后来回到同济大学任教。故事发生在多年前。NASA 火星车勇气号和机遇号登陆后,因火星环境与地球测试需不一样,轮高效方式定位误差每天接近百米;纯视觉方式划受限于地表特点稀少,也只能降到约五十米。李荣兴团队没有后续堆算法,而是探究每块石头带来的定位误差,为不一样地标分配权重,最后将误差降至一米。原本设方式寿命只有 90 个火星日的机遇号,最后服役约十五年、行驶超过 45 公里。这套「寻找稳固地标控制误差」的方式,后来也被用于祝融号、嫦娥任务和极地冰盖项目。「其实到目前我们总结,它本质上就是一个质量贡献的因子库。」周源说。便捷来说,质量贡献因子库,是照章性场景中可能出现的物体,会对数据质量产生意义、对不一样的传感器产生意义,开展定性和定量探究的数据库。举几个便捷的例子:玻璃、白墙这类高反射无纹理物体会严重干扰视觉的定位和构图;树叶这类特点多变的物体,帧间差别很大,不是好的定位特点;而雪糕桶这种视觉友好的物体,高反材质却会让激光产生多馗效应、测距失准。掌握了这些因子,就能很容易地探究出不一样环境下能的数据质量状况。GData Quality Factor Library (QFLab),超亿帧多模态数据积往往,经由专家质检甄别千余种优质因子。因子库本身是一个模型,它训练的,是「观测结荚」与「观测真值」之间的区别。际数有着其他数据企业无法比拟的好处:能够采取相比于数据采集更高阶的测绘技术,为场景构图定位选定真值。这套「观测减真值」的误差量化范式,正是测绘学科区别于纯数据驱动质量评估的地方:它有一个高于被测系统的、独立的真值来源。多模态数据处理步骤,quality-aware 模型感知场景内的可靠锚点,经由 4D 重建形成时空自洽的多模态传感数据关联,进而促进下游仿真生成任务的处理效率和处理成效。这正是来自测绘背景的技术团队的精髓和竞争力:提前把数据质量状况解出来。目前在智驾领域,际数的因子库已经覆盖五千多公里场景,照章性激光雷达、视觉、惯导和 GNSS 定位分别做了质量因子的积往往。大量未过检数据是宝贵的财富但数据质量从来都不是定性的,在不一样任务场景下有不一样定义。大量人类主观判断的因素,反而是做好数据质量中最难的部分。2024 年,智驾行业提出端到端方式划,其本质是表现克隆(Behavior Cloning),通过观测结荚和人类表现,学习人是对车的操控。这给了叶文凯启发:质量控制的本质和这件事惊人地像,能不能通过对原始数据和交付成果的观测,学习人类的判断表现,训练出一个模仿人做质检的模型?便捷来说,际数把质检人员的判断表现完善留存下来,用人的判断馗来训练质量模型,这是特别创新的一步。这与目前的 harness 工程中 skill 的理念不谋而合,持续将不可量化的能力持续沉淀为步骤、经验和技巧。让质检员不只给出「过」或「然而」,还关键留下为什么,记录进一条专业设方式的流水线,并加入自然语言和标签。多模态数据处理动态工作流,质量因子库持续集成人类质检专家经验,一部分给予不一样场景下的质量因子 KV 参考,另一部分促进质量模型高效轮闭环。质量模型在 2025 年底实现训练,2026 年 Q1 试用、Q2 性能趋于稳固,谝得与人类特别接近。如今际数内部的算法步骤已经变了:各垂类模型或算法的推理结荚先经质量模型评估、暴露状况,有状况就返工,形成闭环。人和质检模型一旦产生分歧,二次检核基础都是质量模型胜出。从这点来看,际数科技完全有能力直接去做具身智能的端到端训练,但难能可贵的是,他们选项了用强大的技术力去深耕数据质量这条路。当我们问方式这个状况的时候,周源博士说:「假如说我关键去做具身,数据质量状况肯定题。既然不比如怎样我都得处理数据质量状况,我不如专心的把数据质量状况处理好。」就像叶文凯博士说的,「我们形成了一个认知,直接去发现 A 到 B 的一个馗。和判断某个点离 B 有多远,是两种难度 Level 的状况。」这一思路既延续了测绘学中通过局部观测逐步逼近目的的经典方式比如,也与现代机器学习中的残差思想不谋而合:相比一次性求解全局馗,更关注目前状态与目的之间的 “差距”,并据此持续校正、往往代逼近。有意思的是,这套质量模型「吃」的数据,恰恰是别人扔掉的那些。行业里的数据采取极其奢侈。具身采集一百小时,真正送进训练的可能只有十到二十小时,中间是一个巨大的数据漏斗。以抓握动作为例,精度需亚厘米级的精密操作,超过就丢弃,可这条数据只是对这个详详见细任务失效了,拿去训练精度需没那么高的通用表现,其实还能用。过检数据只顺应某个详详见细分布,然而检的数据反而充足广泛,能揭露设备故障、语义歧义、场景状况、操作不原则等共性状况。「过的数据对某个详详见细任务有价值,然而的数据对评估整个具身更有价值。」际数就是拿这些「有质量状况的数据」去喂自己的模型。「就跟炼油一样,」周源笑方式,「炼石油时沥青本是关键丢弃的废物,可后来发现它能铺路、能做塑料、还能发电。数据正着用、反着用,都能创造价值。」独一无二的技术背景可以说,测绘行业的背景,构成了际数科技在空间数据质量上的底气。用测绘的精度,重新定义空间智能的数据底座。有人会问:测绘面对的东西相对静态,具身面对的是动态、有交互的世界,这套经验真能迁移吗?周源的回答是,测绘从来不只是刻画静态基准,它一直有一个更大的挑战,就是认识和预测世界的变化,这套「变化检测」的方式比如,让他对如今火热的世界模型格外亲切。题在于:先刻画一个极精准的静态状态,再去感知变化,难度会大幅减小。这在智驾里已被验明正身,有了很好的静态基座,再去做车辆检测、表现和轨迹识别都有显著提高。叶文凯出身华为,历经完善自动驾驶的技术路线演进与量产交付实践。华为智能驾驶研发经历让他深刻认识到:复杂系统开发中,最题的频仍不只是代码本身,更是那些在首先期实践中不断积往往、沉淀下来的状况与测试用例。此后,他将这一认知带入际数的数据工作中,持续把真实场景中的状况经验转化为可复用、可往往代的数据质量能力。他从智驾和具身的比较里看到,具身智能从传感器配置到模型感知范式均尚未收敛,对应的数据需也呈现出高度异构、难以统一的面貌。但可以预期,未来具身数据的演进将经历从数据匮乏、数据泛滥到优质场景数据精筛的时期性跃迁。他甚至有一个大胆的说法:质量本身可以成为一种模态。「大家说视觉、语言、动作(VLA),我觉得可以是视觉、语言、质量、动作。」因为质量会直接意义表现:抓握时如果测距误差有二十公分,机器人只会后续往前伸;精度到五公分以内,它才能清楚做出抓取动作。际数对这套体系的护城河有着清醒的判断:真正难以被复制和逾越的,是首先期沉淀形成的质量认知与专家经验。「时间其实是最友好的壁垒。」即便是有钱有人的大厂进场,投更多人、更多设备,也绕不开把一个个场景的质量状况实测、磨出来的流程。「质量因子库」正是这类经验的具象化载体。在目前 AI 辅助人类协作的模式下,人最不可替代的价值,正体目前对详详见细状况的经验判断与认知沉淀上;而这些认知也能够跨越人员与任务,实现共享、复用与持续往往代。稳固的商业馗际数的三位联合创始人,命运都被「数据」牵动着。CEO 周源是武汉大学测绘工程博士、同济大学博士后,师从李德仁院士,武汉大学与俄亥俄州立大学联合培养,曾参与 NASA/JPL 火星车空间定位与制图,参与主持过多项国家重点项目与国家原则制定,获中国测绘科技发展奖一等奖。负责公司战略方向与空间智能质量基础模型定位。CTO 叶文凯是同济大学测绘与遥感博士,同济大学与佐治亚理工联合培养,师从李荣兴院士,曾参与南极冰川探究等国家重点科研项目,曾在华为、极氪从事智能驾驶研发,熟悉场景数据建模与智驾数据闭环。负责技术体系搭建与产品实现。联合创始人邹小弟,有 20 年以上汽车行业经验,前博世中国销售总监、前百度 IDG 销售总监。负责商业化与项目交付。「一个做数据,一个卖数据,一个用数据。」周源在项目里见过太多数据上的状况,邹小弟在智驾方式划销售中感受到质量对交付的痛点,叶文凯则直接是智驾厂商的数据用户,亲身体会过大量资源都耗在等数据上。「我们三个人加在一起,能够看到整个行业。」从生产、销售到采取,三个不一样位面的人看到了同一件事:空间数据的质量状况对下游的伤害有多大,这是一个共性需。负责商业化的邹总把际数的馗总结为从「以质取胜」到「复售」。早期公司小,客户凭什么信一家小公司?靠质量。在智驾业务里,他们盯着帧准率和元准率这两个客户最看重的指标:行业早期常见定在 95%,后来提到 98%,而际数在成立之初就做到接近 99% 以上。量少,但客户愿意为「质」买单。在这个基础上,际数用工程、算法和数据基座能力构建起高价值场景基座,客户以付费订阅模式接入,几年下来资产像滚雪球一样越滚越大,由此衍生出第二种模式:优质数据集的定制。目前已有约十家客户付费采购并实现复售。「大量公司是客户说什么就做什么,有点像来料加工。我们的逻辑不一样。」际数的区别化在于「漏斗」的概念:他们会站在客户算法模型的角度,从规划采集的首先步一直陪客户走到数据进模型训练,每个环节怎么控制场景质量、切片质量、清洗质量、标签质量。几个数字颇能反映这套打法的健康度:客户转化率在 80% 以上,验收通过率基础 100%,回款基础按时全额到账。客户群体也从早期的算法公司,今年最初转向 OEM 车企为主。2024 年,一家头部智驾算法企业找到际数科技生产生产一批高精度车方式感知数据,每组数据涵盖7 路环视相机、1 路激光雷达和 1 路 GNSS 观测。际数用约 35 天实现需对齐、POC 及首先期 10 万组交付,达成了客户超半年也未能成功的生产,最后同时实现亚像素级反投、3 厘米内空间误差、100% 关键素完善率和 99% 以上分类准确率。首先期交付后,客户立即追加 60 万组订单;截至 2025 年 10 月,双方六期合作往往方式交付 395 万组次。更题的是,际数已经实现了从数据的一次性交付进化成了可持续复用的数据资产。客户技术栈升级后,际数依托完善的场景基座和原子化数据条件,直接重组历史数据,替代重新采集;之后任务中,超过 60% 的历史数据被再次调用,交付周期和成本显著减小。「假如关键选一个最快实现数据高效轮的场景,哪一个会最快?」周源的探究是:家庭。数据高效轮的实现,一定关键有人机的高往往交互。智驾为什么能形成高效轮?因为人可以接管汽车,而这个「接管」本身就是极高价值的数据。物流、工厂虽然能讲很好的商业模式,但它们是纯自动化的流程,一旦需人类干预就说明失败了。家庭则不一样。家庭对智能化设备的包容度特别高。「能选到一千个家庭部署机器人,初步的高效轮就有了。」高效轮一旦转起来,不停有人类输入进来纠正,初步的智能就只是时间状况,这正是表现克隆能跑通的地方。作为前置上游的第三方基础设施,际数的场景和数据好处在这个兵家必争之地最能体现价值。结语:具身时代的精炼厂际数科技的名字本身是个谐文章梗,既搞技术又搞科技;更深一层,「际数」隐含着探求数据边界、拓展数据价值的含义。我们知方式,全球自动驾驶数据标注市场在 2025 年约为 50 亿美元,年复合增首先率超过 25%;具身智能数据市场预方式在 2026 年实现 10 亿美元,并有望于 2030 年突破 100 亿美元。按照目前的数据漏斗与采集成本估算,关键获得一亿小时有效训练数据,可能需采集上百亿小时的原始数据,投入高达数百亿甚至数千亿元。质量不只是一个绕不开的痛点,更是撬动数据有效率的一根杠杆。在价值 3000 亿的数据规模下,只关键能将数据合格率提高 10%,就是高达 300 亿的市场价值的释放。自动驾驶是目前时,具身智能是未来时。场景在变化,模型在往往代,但对物理世界的准确刻画、对多模态时空数据的可靠对齐,是可以跨越赛方式、反复复用的底层能力。工业时代需石油,但原油只有经过精炼,才能真正成为工业血液;智能时代需数据,而空间数据同样需一套精炼基础设施。随着智能革命向前推进,数据正在成为整个行业的基础设施,优质的数据则决定了这套基础设施能够把行业带多远。际数科技把百年测绘对误差的偏执,变成了具身智能时代一把丈量数据的尺子,一座建立在数据资源上的精炼厂。

访客,请您发表评论:

网站分类
热门文章
友情链接

© 2026. sitemap