电台主播戴上MR眼镜直播,听友能走进3D声场但设备成本成最大门槛
说实话,这事儿听起来就像科幻片里的场景,但人家已经真真切切发生了。
想象一下,你戴上MR眼镜,坐在自家沙发上,突然感觉电台主播就站在你面前,不,是站在一个虚拟的录音棚里,四周是环绕的声音,每一句话都有方向感,左边是钢琴,右边是贝斯,中间是主播的声音从远处传来,越说越近。这不是做梦,这是现在有些胆大的电台已经在尝试的东西。
先别急,咱们从头捋一捋这玩意儿到底是个啥
MR眼镜,全名Mixed Reality眼镜,说白了就是既能看到真实世界,又能把虚拟的东西叠加进去。不像VR那种把你彻底关进小黑屋,MR让你睁开眼,还能看见现实,只是多了几层”叠加”。
2023年Meta出了Quest 3,苹果后来也入了场,Hinge Vision、PICO这些国产玩家也在追赶。这些东西的技术路线其实挺有意思,有的用透视,有的用外部摄像头,有的干脆搞透明Micro-OLED屏。总之,让虚拟和现实”握手言和”是目前主流方向。
3D声场就更不玄乎了。简单说,就是声音不只是从左右两个喇叭出来,而是从各个方向、各个距离传来。你在家里听歌,是不是总觉得声音是”平的”?那种左右声道,感觉所有声音都挤在一条线上。3D声场就是把这个平面撕开,让声音”立体”起来,前面、后面、上面、下面,全都有。
这两样东西凑到一起,就诞生了所谓”沉浸式电台直播”——主播在虚拟空间里讲话,听众戴上设备,感觉自己真的走进了那个空间,而不是通过一个扁平的耳机听声音。
这技术是怎么跑起来的?
先说主播那边。主播不需要什么高科技,就是一台电脑、一个麦克风,再加一副MR眼镜。戴上眼镜之后,屏幕上会显示出一个虚拟的直播间,主播能看到虚拟的听众头像、虚拟的设备、虚拟的氛围灯。主播说话的时候,麦克风录进去的不只是声音,还有声音在虚拟空间里的”位置信息”——主播站在虚拟房间左边还是右边,说这句话的时候有没有转头,这些都能被捕捉到。
然后就是技术公司在背后干的事。声音从主播那边传出去,不是普通的MP3或者AAC格式,而是用了空间音频编码,比如苹果的 Dolby Atmos,或者开源的 ambisonics。这些编码方式能把声音”打包”成更有方向感的形式,传输到听众那边。
听众戴上MR眼镜,打开手机或者PC上的客户端,系统会根据他们眼镜的位置,实时调整声音的方向。你歪一下头,声音好像也跟着你转了;你往前走一步,主播的声音就更清晰了。这就是所谓的”3D声场”体验,技术上叫HRTF,Head-Related Transfer Function,简单说就是人耳对声音方向的感知模型。
举个具体的例子,有个叫”声临其境”的团队在2024年做了一次实验性直播,主播戴的是PICO 4 Enterprise,听众用的是Quest 2。主播在虚拟录音棚里弹吉他,吉他声从左边传来,人声在中间偏右。听众戴上眼镜之后,确实感觉到了方向差异,有反馈说”第一次听到自己的声音好像真的在房间里转圈”。
技术上可行,这事儿没问题。
但是——设备成本是个拦路虎
说句实在话,这玩意儿现在最大的问题就是贵。
我们一个一个来算。
主播那边的设备,MR眼镜本身不便宜。Meta Quest 3目前售价大概是500美金左右,国内差不多3000多人民币。PICO 4也是类似的价位。如果要做专业级直播,可能还要配个高性能PC来跑渲染,一块RTX 4070显卡大概5000多,整机下来轻松过万。
听众那边呢?Quest 3也是3000多,PICO 4也差不多。这意味着,一个听众要想获得完整体验,至少得花3000块钱买设备。
3000块是什么概念?现在一个不错的真无线耳机也就两三千,一个普通蓝牙音箱一千出头。让一个普通听众为了听个电台,花3000块买个眼镜——这不是开玩笑吗?
咱们再看看其他成本。
内容制作成本。传统的电台直播,一个主播、一个调音师、一个直播间,成本可控。但3D声场直播不一样,你需要懂空间音频的工程师,需要懂虚拟场景搭建的人,可能需要专门的3D建模师来做直播间环境。这些都是额外的人力成本。
还有个问题很多人没考虑到——网络带宽。空间音频的数据量比传统音频大得多,尤其是高保真的ambisonics格式,一个小时的直播可能产生几个GB的数据。对听众来说,如果网络不好,体验直接拉胯。
那这事儿还有救吗?
有,但需要时间。
从历史来看,任何新技术从实验室走向大众市场,都要经历一个”贵→便宜→普及”的过程。VR头盔十年前也是天价,现在Quest 3已经跌到3000以下。MR眼镜的技术进步速度很快,苹果、Meta、国产厂商都在使劲,价格迟早会降下来。
但短期之内,这确实是个门槛。
有人可能说,那能不能不用眼镜?毕竟现在有些手机App也能模拟3D声场效果,比如用耳机模式做HRTF渲染。这个思路是对的,而且已经有产品在做了。Spotify的3D音频、索尼的360 Reality Audio,都是通过耳机来实现”伪3D”体验的。虽然不如MR眼镜那么沉浸,但至少不需要额外买硬件。
还有个方向是云渲染。把眼镜的计算压力转移到云端,这样耳机可以做得更便宜,甚至普通耳机也能用。不过这对网络的要求更高,目前国内5G覆盖还不够完善,这也是个问题。
这事儿的本质是什么?
说到底,电台的核心价值是”陪伴”和”声音”。MR+3D声场是想把”陪伴感”升级,让你觉得主播就在身边,不只是声音,还有空间感。这个方向没问题,问题是现在成本太高,用户体验还没到”非用不可”的程度。
如果未来MR眼镜像智能手机一样普及,这事儿就成了。但如果十年后大家还是用普通耳机听播客,那这可能就是个 niche 的小众玩法。
技术这东西,从来不是”能不能做”的问题,而是”值不值得做”的问题。现在的成本,对于发烧友和科技爱好者来说,可能还勉强能接受。但对于大众市场,确实还是太贵了。
咱们不妨多等等,说不定三年五年后,这玩意儿就像现在的智能音箱一样,随处可见了。
