计算机视觉:渗透进产业的隐形技术革命
你今天掏出手机解锁,路过停车场自动抬杆,刷短视频的时候被精准推了感兴趣的内容——这一整套流程里,都有计算机视觉在干活。大多数人只会把它当成AI的一个分支,没太当回事。其实它是目前所有AI技术里,落地最成熟、商业化最顺的一个。
没那么神奇。也没那么无用。
卷积神经网络计算机视觉结构示意图
很多人吹它已经超越人类视觉,其实哪有这回事。现在的计算机视觉,闭集识别已经玩得很溜——什么叫闭集?就是提前框好要认的东西,比如人脸识别,车牌识别,只要样本够,准确率能到99%以上。但碰到开集场景,比如路上突然冲出一个你从来没见过的新型异形电动车,模型很可能就认成别的东西。碰到遮挡、逆光、水雾这种极端条件,出错率更是直接飙升。我去年在一个港口项目上见过,雾气大的时候,集卡箱号识别的准确率能从98%掉到60%,根本用不了。还得靠人工补。
说白了,它现在就是一个非常好用的工具,但还远没到无所不能的地步。
工业生产线计算机视觉缺陷检测场景图
不过话说回来,落地的坑比你想象的多。大部分传统行业的场景,根本不是标准化的。同一个缺陷,放在不同的工厂,光照不一样,产品摆放不一样,甚至生产线速度不一样,原来的模型就用不了。换一次产品,就得重新标注几千张图,训一次模型,少则几万多则几十万,很多中小工厂根本掏不起这个钱。还有农业里的病虫害识别,果园里的叶子沾泥带水,不同季节病虫害样子不一样,通用性差到离谱,至今没有跑通大规模盈利的模式。对吧?
现在整个产业的格局很清楚:上游是芯片和算法框架,英伟达的GPU还是主流,国内几家做AI芯片的,已经在端侧场景抢下来不少份额。中游算法公司都在往下游扎,只做算法的公司活不下去,必须自己做集成,搞定场景,才能赚到钱。下游就是看谁能把成本压下来,谁就能赢。
风险与未来:接下来三年会怎么走
技术跑得太快,治理跟不上,已经出了不少问题。最突出的就是人脸识别滥用,前几年随便一个小区商铺都装人脸采集,把个人生物信息随便存在本地,泄露风险极大。还有深度伪造,现在随便一个人花几十块钱就能做一条换脸视频,用来诈骗、造谣的案例已经不在少数。去年我听过一个案子,骗子用深度伪造换脸成老板,骗了财务几百万,半天就转了账,根本没来得及反应。
现在国内《个人信息保护法》出来,对生物信息采集管得越来越严,其实是好事,洗掉一批蹭热点不合规的公司,剩下的才能正经做事。
对接下来三到五年的走向,我有几个判断。第一,技术会从「识别物体」走向「理解场景」。现在大部分应用还是回答「这是什么」,接下来会往「发生了什么」「接下来会发生什么」走。比如自动驾驶,不是只认出前面有个行人,还要能判断行人的动向,会不会横穿马路,提前做出反应。第二,大模型+小样本微调会变成主流。原来每个场景要攒几万张标注图,成本几十万,现在用通用的计算机视觉大模型,只需要几百张标注图微调就能用,成本直接砍到十分之一,中小工厂也用得起,这个会把整个市场盘子做大好几倍。第三,端侧落地会成为大趋势。原来都要把图像传到云端算,延迟高,还容易泄露隐私,现在端侧AI芯片性能上来了,直接在本地就能跑模型,延迟降到几毫秒,隐私也有保障,以后监控、工业相机、汽车都会往这个方向走。
说实话,我见过太多创业者把计算机视觉吹得玄乎,说要颠覆这个颠覆那个。其实它就是一个基础技术,和一百年前的电力没什么区别。不会突然搞出一个天翻地覆的变化,只会慢慢渗进各个行业的缝隙里,悄悄把原来人工干的累活、危活、准确率低的活换掉。这个过程,可能比所有人预想的都慢,但也比所有人预想的稳。
拨开术语迷雾:计算机视觉的能与不能
核心目标其实一句话就能说清:让机器像人一样,「看见」并「看懂」图像和视频里的内容。早几十年的技术路径是提取特征、规则匹配,错漏百出,根本用不了。直到卷积神经网络出来,搭上深度学习的快车,准确率一下冲过了人眼,才开始真正产业化。
卷积神经网络计算机视觉结构示意图
很多人吹它已经超越人类视觉,其实哪有这回事。现在的计算机视觉,闭集识别已经玩得很溜——什么叫闭集?就是提前框好要认的东西,比如人脸识别,车牌识别,只要样本够,准确率能到99%以上。但碰到开集场景,比如路上突然冲出一个你从来没见过的新型异形电动车,模型很可能就认成别的东西。碰到遮挡、逆光、水雾这种极端条件,出错率更是直接飙升。我去年在一个港口项目上见过,雾气大的时候,集卡箱号识别的准确率能从98%掉到60%,根本用不了。还得靠人工补。
说白了,它现在就是一个非常好用的工具,但还远没到无所不能的地步。
落地深水区:碎场景里的真赚钱和真问题
早十年国内计算机视觉公司,基本靠安防项目吃饭,靠智慧城市、天网工程起的家。现在安防卷完了,大家都往垂直行业钻,真正赚大钱的场景,其实都在工业里。比如工业产品缺陷检测,原来工厂靠老工人肉眼看电路板、玻璃、汽车零部件,一天干八个小时,准确率最多到95%,碰到细小的划痕根本看不出来,还留了品控隐患,工人老花眼的概率比别的行业高太多。现在用计算机视觉,准确率能到99.9%,还能24小时连轴转,投入的成本一年就能收回来。很多做这个赛道的小公司,这两年活得比头部AI公司舒服多了。
工业生产线计算机视觉缺陷检测场景图
不过话说回来,落地的坑比你想象的多。大部分传统行业的场景,根本不是标准化的。同一个缺陷,放在不同的工厂,光照不一样,产品摆放不一样,甚至生产线速度不一样,原来的模型就用不了。换一次产品,就得重新标注几千张图,训一次模型,少则几万多则几十万,很多中小工厂根本掏不起这个钱。还有农业里的病虫害识别,果园里的叶子沾泥带水,不同季节病虫害样子不一样,通用性差到离谱,至今没有跑通大规模盈利的模式。对吧?
现在整个产业的格局很清楚:上游是芯片和算法框架,英伟达的GPU还是主流,国内几家做AI芯片的,已经在端侧场景抢下来不少份额。中游算法公司都在往下游扎,只做算法的公司活不下去,必须自己做集成,搞定场景,才能赚到钱。下游就是看谁能把成本压下来,谁就能赢。
风险与未来:接下来三年会怎么走
风险与未来:接下来三年会怎么走
技术跑得太快,治理跟不上,已经出了不少问题。最突出的就是人脸识别滥用,前几年随便一个小区商铺都装人脸采集,把个人生物信息随便存在本地,泄露风险极大。还有深度伪造,现在随便一个人花几十块钱就能做一条换脸视频,用来诈骗、造谣的案例已经不在少数。去年我听过一个案子,骗子用深度伪造换脸成老板,骗了财务几百万,半天就转了账,根本没来得及反应。
现在国内《个人信息保护法》出来,对生物信息采集管得越来越严,其实是好事,洗掉一批蹭热点不合规的公司,剩下的才能正经做事。
对接下来三到五年的走向,我有几个判断。第一,技术会从「识别物体」走向「理解场景」。现在大部分应用还是回答「这是什么」,接下来会往「发生了什么」「接下来会发生什么」走。比如自动驾驶,不是只认出前面有个行人,还要能判断行人的动向,会不会横穿马路,提前做出反应。第二,大模型+小样本微调会变成主流。原来每个场景要攒几万张标注图,成本几十万,现在用通用的计算机视觉大模型,只需要几百张标注图微调就能用,成本直接砍到十分之一,中小工厂也用得起,这个会把整个市场盘子做大好几倍。第三,端侧落地会成为大趋势。原来都要把图像传到云端算,延迟高,还容易泄露隐私,现在端侧AI芯片性能上来了,直接在本地就能跑模型,延迟降到几毫秒,隐私也有保障,以后监控、工业相机、汽车都会往这个方向走。
说实话,我见过太多创业者把计算机视觉吹得玄乎,说要颠覆这个颠覆那个。其实它就是一个基础技术,和一百年前的电力没什么区别。不会突然搞出一个天翻地覆的变化,只会慢慢渗进各个行业的缝隙里,悄悄把原来人工干的累活、危活、准确率低的活换掉。这个过程,可能比所有人预想的都慢,但也比所有人预想的稳。