科思研究

AI造出的偶像,永不塌房?

科思律师事务所 · 2025-04-07
文章插图

《法律人必备AI核心技能》,可直接点击下图购买:

随着《创造营亚洲第二季》的收官,从2018年选秀热潮开启至今,一批又一批年轻的偶像如同商品一般被快速的上架、淘汰。而当表面的光鲜退去后,偶像行业却似乎陷入了一个尴尬的循环:粉丝渴望“颜值在线、实力顶尖、人品可靠”的完美偶像,而现实却频频上演“人设崩塌”“舞台翻车”的闹剧,听起来像是在自嘲“塌房险”,也是粉丝们对现实无奈的反映。

当现实偶像的局限性日益凸显,AI技术悄然开启了一个新赛道——“从代码到偶像,一切皆可定制”。随着AI工具的开发,更是让这场“造星革命”变得更加具有现实性。

01

完美偶像三要素,AI工具如何实现?

首先AI偶像不完全等同于虚拟偶像,AI偶像是指完全利用AI技术堆砌出的“虚拟偶像”,两者最大的区别在于AI偶像不需要“中之人”的存在。例如外网的AI网红 Lil Miquela[1]和全球首个AI女团Sorai.ai[2]。

那么,如何利用AI技术训练出一个完美的偶像呢?

1 完美的外在形象

NVIDIA Style GAN3[3]通过大量人脸数据训练,利用生成式对抗网络生成皮肤纹理、控制动态表情,创造出近似人类的虚拟形象;Eleven Lab[4]的Voice Design运用SVC技术,突破人类声域,能生成逼真声线,还允许用户设置参数创造新声音。阿里LHM[5]只需一张普通照片,几秒内就能生成可自由活动的3D虚拟形象。

文章插图

(图片源自于 Sorai.ai Youtube账号)

2 能打的业务能力

全球首个引入 CoT 技术的音乐模型 Mureka O1[6],依据情绪标签,如 “失恋/电子风”,就能输出词曲编混成品;舞蹈编创领域,DisPose[7]结合一段跳舞视频与参考图片,自动实现可控人像动画跳舞,配合可灵AI[8]的3D Traj Master,让用户轻松实现复杂动态效果。基于文本的 Syn Cam Master,支持多相机视角变化,依据文字描述和相机位姿信息,生成多段不同视角且时序同步的视频。

文章插图

(图片源自于 Mureka官网)

3 细腻的情感陪伴

借助情感计算技术[9],运用多种机器学习算法训练情感识别模型,结合皮肤电活动传感器、脑机接口等捕获生理信号,再通过面部动作编码系统和自然语言处理,AI 偶像可实时互动。[10]

这种由AI驱动的创作闭环不仅实现了从外在形象到音乐制作再到情感呈现的全流程智能化,更通过技术融合创造出超越人类生理极限的艺术表现形式。

02

技术赋能,可能存在哪些法律风险?

-以声音权为例

当算法开始重塑偶像产业的底层逻辑,法律体系也正面临前所未有的挑战。这种挑战既来自技术创新对传统权利边界的突破,更源于数字形象与真实主体间的权利纠葛。以声音克隆为例,2024年微软发布了零样本的文本到语音(TTS)模型VALLE-2[11],首次实现了与人类同等的水平,可以高效的模仿声音,同时也埋下了法律隐患。

文章插图

(图片源自于 VALLE-2官网)

1 AI生成声音侵权的认定标准

北京互联网法院全国首例AI生成声音人格权侵权案的判决确立了判定AI生成声音侵权的核心标准,即“生物特征可识别性”。法院认为:利用人工智能合成的声音,如果能使一般社会公众或者相关领域的公众根据其音色、语调和发音风格,关联到该自然人,可以认定为具有可识别性,明确认定在具备可识别性的前提下,自然人声音权益的保护范围可及于AI生成声音。

2

AI是否都在模仿谁?

如今,AI生成技术对人类生物特征的数字化复制已达到令人不安的精度。与此同时,我们不得不思考的问题是:或许我们可以利用AI技术生成一个不存在的声音、一张不存在的脸、一种不存在的性格,但不论是从用户的角度还是从算法的逻辑来看,都很难排除一种可能性——AI生成的产物究竟是完全不存在的,还是基于既有的现实模仿、拼凑而成的?

依然是以声音权为例,声音合成主要可以根据声音的处理方式具体分为两类:一类是直接使用自然人声音,如通过音频、视频等形式对自然人声音录制、公开、模仿、拼接、篡改等;另一类是利用人工智能技术合成新的声音。[12]

从法律属性上看,两类声音处理方式存在本质差异。

直接使用自然人声音的行为通常构成对既有声音权的直接侵害,其侵权认定可援引《民法典》第 1019 条关于肖像权保护的类推适用规则。而AI合成声音则涉及技术性更强的法律空白领域:

首先,合成声音的过程中可能涉及侵权。通常而言,训练方为了使AI输出的声音更加近似于某种声线,会将自然人的声音片段“投喂”给它,“投喂”的素材越多,生成的声音准确度、还原度就越高。在这个过程中,由于“投喂”训练素材需要使用自然人原本的声音,若未经自然人许可就直接使用,则构成对自然人合法权益的侵害。

向上滑动阅览

相关规定:

《生成式人工智能服务管理暂行办法》

第7条 生成式人工智能服务提供者(以下称提供者)应当依法开展预训练、优化训练等训练数据处理活动,遵守以下规定:

(一)使用具有合法来源的数据和基础模型;

(二)涉及知识产权的,不得侵害他人依法享有的知识产权;

(三)涉及个人信息的,应当取得个人同意或者符合法律、行政法规规定的其他情形;

……

《生成式人工智能服务安全基本要求》(TC260-003)

5 语料安全要求

5.1 语料来源安全要求

C)4)将使用者信息当作语料时,应具有使用者授权记录。

5.2 语料内容安全要求

B)2)语料用于训练前,应对语料中的主要知识产权风险进行识别,发现存在知识产权侵权等问题的,服务提供者不应使用相关语料进行训练……

其次,若AI生成的是完全原创的虚拟声音,则可能落入著作权法中的邻接权保护范畴。我国《著作权法》明确将录音录像制作者权纳入邻接权体系,根据《中华人民共和国著作权法实施条例》第5条第2款,录音制品是指任何对表演的声音和其他声音的录制品。根据文义理解,其保护范围不仅限于对既有声音的机械复制,还包括对声音的首次固定行为。对于AI生成的虚拟声音,若其通过算法独立生成且未直接复制自然人声音,则可能被视为“录音制品”并受邻接权保护。[]这种技术边界的模糊性导致现行法律难以对“模仿程度”与“创造性表达”作出量化区分,司法实践中需结合声音特征的独特性、算法训练数据的来源合法性等多重因素进行综合判断。

3 可识别性判定

简言之,现行法律框架下的人格权保护主要以“可识别性”为前提,那么应该依据什么标准来认定个人声音是否可以被识别。对此,可以参照肖像权侵权的实践。在我国司法实践中,法院对肖像权侵权的表述是“一般的社会公众”“在一定的观众范围内”或“一般的公众”[14],对于声音的可识别性也应当以此为参考。

此外,声音具有非物质性、可复制性和技术依赖性等特征,其可识别性判断需结合主客观双重标准。主观标准以社会一般公众的认知能力为基准,要求声音在特定传播环境中能够引发与权利人的直接关联;客观标准则需考量声纹特征、语音语调、发音习惯等物理属性。

对于人工智能技术生成的声音,其可识别性认定需特别关注技术处理对声音特征的影响,关键在于该声音能否通过技术处理还原权利人的人格特征。对于人工智能技术处理后的声音,一般社会公众或者一定范围内的公众根据音色、语调和发音风格,能够识别出特定自然人的,则该声音属于自然人声音权益的保护范围。[15]

向上滑动阅览

相关规定:

《民法典》

第990条 人格权是民事主体享有的生命权、身体权、健康权、姓名权、名称权、肖像权、名誉权、荣誉权、隐私权等权利。

除前款规定的人格权外,自然人享有基于人身自由、人格尊严产生的其他人格权益。

第1018条第2款 肖像是通过影像、雕塑、绘画等方式在一定载体上所反映的特定自然人可以被识别的外部形象。

第1019条 任何组织或者个人不得以丑化、污损,或者利用信息技术手段伪造等方式侵害他人的肖像权。未经肖像权人同意,不得制作、使用、公开肖像权人的肖像,但是法律另有规定的除外。

未经肖像权人同意,肖像作品权利人不得以发表、复制、发行、出租、展览等方式使用或者公开肖像权人的肖像。

第1023条第2款 对自然人声音的保护,参照适用肖像权保护的有关规定。

03

当AI堆砌的偶像崛起,我们在追捧什么?

技术狂飙的背后,一个更尖锐的问题浮现:如果说虚拟偶像还可以粉情商和业务能力,那当这一切都变成代码时,粉丝爱的究竟是“偶像”,还是被算法精心筛选的“数据集合”?

对资本而言,AI偶像是稳赚不赔的生意——无需分成、无限复制、输出稳定、永不违约;

对粉丝而言,AI偶像提供了一种“安全的情感投射”:不必担心塌房,甚至可以定制专属互动;

但对社会而言,这种“完美”是否在制造新的精神鸦片?当AI偶像比真人更懂如何取悦人类,真实的情感连接是否会进一步瓦解?

AI技术制造的偶像越完美,反而越像一面镜子,照出人类对“可控性”的极致追求。然而,偶像文化的魅力,本就在于真实人格与梦想的交织——瑕疵、成长,甚至失败,才是共情的源泉。AI与偶像的未来,或许不是“取代”,而是“共生”:AI负责提供更多创造的可能性,而人类偶像继续诠释那些代码无法模拟的,关于热血、遗憾与蜕变的故事。

毕竟,完美可以量产,但真实永远稀缺。

《法律人必备AI核心技能》,可直接点击下图购买:

参考资料

[1] 竞争逻辑已变,当年入7600万的数字网红Lil Miquela成为顶流:https://mp.weixin.qq.com/s/uFaUsakePrj6FoYDL1G36Q

[2] 全球首个AI女团首秀倒计时 - Sorai.ai出道计划独家揭秘:https://mp.weixin.qq.com/s/c3sIyv0AP0pYSxyTXIPLbw

[3] StyleGAN3问世,等变性perfect!皮肤、毛发不再粘屏幕,还能360度旋转 | 已开源:https://mp.weixin.qq.com/s/Eyj-zB3DHAxik1pyJbX1KA

[4] ElevenLabs:为内容创作者赋予声音:https://mp.weixin.qq.com/s/Rmb-X49VqKxFSwTg3VfDfw

[5] 阿里通义放大招!LHM项目:一张图、一个参考视频即可生成3D动画人:https://mp.weixin.qq.com/s/W8kA0aQVe8sXjmZrH4NlhA

[6] 昆仑万维发布全球首款音乐推理大模型Mureka O1,中国AI音乐革命领跑全球:https://mp.weixin.qq.com/s/1JPYXUwX-1JAVpz3IgygtQ

[7] 北大研究者开源Dispose模型,实现可控的人像动画跳舞:https://mp.weixin.qq.com/s/jvqosfiSEFLTJnfN_tWgag

[8] 可灵视频生成可控性为什么这么好?快手又公开了四篇研究:https://mp.weixin.qq.com/s/3NI9YITmCrd8cDT1YMlA9A

[9] 严冰丨不间断的机器:从情感计算通向机器情感:https://mp.weixin.qq.com/s/L9AyMqivyfJObKywRStyVg

[10] 情感AI在增强人机交互方面的作用:https://www.sohu.com/a/693356009_121357571

[11] 语音克隆达到人类水平,微软全新VALL-E 2模型让DeepFake堪比配音员:https://mp.weixin.qq.com/s/qJNFaI236R1xJrdVT2O1Bg

[12] 赵瑞罡,孙铭溪,田涵.AI生成声音侵害声音权益的法律认定——以殷某某诉北京某智能科技公司等人格权侵权案为例[J]. 《法律适用》, 2024年, 第9期: 123–133.

[13]徐婷婷,张庆栋:人工智能语音合成技术生成物的权利保护:https://mp.weixin.qq.com/s/rP_kH2y-o68QB9bmmDi-Iw

[14] 王绍喜.《民法典》时代声音保护的解释与适用[J]. 《法律适用》, 2023年,第6期.

[15] 入库参考案例:经人工智能技术处理的声音受声音权益保护的认定:https://mp.weixin.qq.com/s/UKep3LjuqKz5Z2zEcN5kgQ

文章插图

●AI生成宫崎骏风图片大火,引发是否侵权讨论

●在自由与秩序之间,为开源大模型搭建“避风港”

●“少年自杀案”风波后,Character.AI推出家长监管功能

文章插图