其他条款
更新·大·大约 2 个月前

支付宝 · 灵光算法及模型备案公示说明

v1 → v2 共2079字净变化

版本演变分析

由 DeepSeek 生成

本次更新为首次备案公示,新增视频生成和音乐生成两项算法,明确算法原理、运行机制及应用场景,属于AI合规备案的实质性新增。

总体评估

本次版本演变的方向与定性

此次更新属于实质性新增,支付宝首次对其视频生成算法和音乐生成算法进行备案公示,详细披露了算法基本原理、运行机制、应用场景及目的意图。这反映了企业积极落实《生成式人工智能服务管理暂行办法》及《互联网信息服务算法推荐管理规定》的备案要求,属于行业领先的合规实践。新增内容完整覆盖了算法透明度义务,包括多模态输入处理、模型架构(时空扩散模型、大语言模型等)、生成步骤等细节,有助于监管审查和用户知情。相比同业,支付宝的备案说明在技术细节披露上较为充分,但未涉及算法偏见、内容安全过滤等风险控制措施,存在一定完善空间。

详细变更点

按条款逐项的变化解读

1. 新增算法 - 支付宝视频生成算法

旧版:无(旧版不存在)

新版:算法名称:支付宝视频生成算法。算法基本原理:基于时空扩散模型(Spatio-Temporal Diffusion Model)和多模态融合技术,该算法能够接收文本、单张或多张图像作为输入,生成高保真度的动态视频。其核心是利用一个大型的Transformer架构,在潜空间(Latent Space)中学习视频数据在空间(画面内容)和时间(运动变化)上的联合分布。模型通过在巨大的视频-文本-图像数据集上进行预训练,理解语…

合规影响

此变更为实质性新增,属于首次备案公示。根据《生成式人工智能服务管理暂行办法》第17条,提供具有舆论属性或社会动员能力的生成式AI服务应当向网信部门备案。支付宝视频生成算法作为AIGC视频生成服务,必须履行备案义务。本次公示明确了算法基本原理、运行机制和应用场景,满足了透明度要求。但未提及内容安全过滤机制、训练数据来源合法性、用户输入内容审核等合规要点,可能面临监管追问。企业需确保算法生成内容符合《网络信息内容生态治理规定》,并建立用户投诉处理机制。

借鉴价值

网易在类似AIGC算法(如游戏内AI生成内容)备案时,可借鉴支付宝对算法原理的详细描述方式,包括模型架构(如Transformer、扩散模型)、输入输出类型、训练数据规模等。但应补充内容安全措施,例如在运行机制中增加“生成内容经过安全审核模型过滤”的表述,以降低合规风险。


2. 新增算法 - 支付宝音乐生成算法

旧版:无(旧版不存在)

新版:算法名称:支付宝音乐生成算法。算法基本原理:支付宝音乐生成算法能够基于用户上传的文本、图片等信息,使用基于深度学习的大语言模型和扩散模型算法,结合用户输入的提示词指令完成音乐及歌词生成。算法运行机制:用户输入提示词文本(或上传图片)后,符合要求的请求会进入意图识别模块,采用大语言模型识别用户的具体生成意图,并生成相应风格和需求的歌词及曲风描述文本;随后歌词和曲风描述文本会经过音乐生成模型,生成相应的音乐,包含人声对歌词的演唱及背景伴奏乐;最后,返回音乐和歌词,显示到用户界面。

合规影响

此变更为实质性新增,属于首次备案公示。音乐生成算法涉及歌词生成,可能涉及著作权问题。根据《生成式人工智能服务管理暂行办法》第4条,生成式AI服务提供者应当依法承担知识产权责任。支付宝需确保训练数据不侵犯他人著作权,并在用户协议中明确生成内容的版权归属。此外,算法运行机制中提及“符合要求的请求”才进入意图识别,暗示存在输入过滤,但未说明过滤标准,可能涉及用户言论审查的合规边界。企业应明确过滤规则并告知用户,避免违反《互联网信息服务管理办法》第15条。

借鉴价值

网易若推出音乐生成类AI功能,可借鉴支付宝对算法流程的清晰描述(意图识别→歌词生成→音乐生成→返回),但应增加版权声明条款,例如“用户生成内容的知识产权归属用户,但用户授权平台在服务范围内使用”。同时,需明确输入过滤规则,避免因不当审查引发争议。


3. 新增算法 - 备案编号

旧版:无(旧版不存在)

新版:备案编号:网信算备330106616449901260079号(视频生成算法);网信算备330106616449901260087号(音乐生成算法)

合规影响

备案编号的公示是履行《互联网信息服务算法推荐管理规定》第24条及《生成式人工智能服务管理暂行办法》第17条的法定义务。编号本身无实质合规影响,但公示备案编号有助于用户和监管机构验证算法合规状态,提升透明度。企业需确保备案信息与实际算法一致,若算法发生重大变更(如模型架构、应用场景变化),应及时更新备案。

借鉴价值

网易在公示算法备案时,应确保备案编号准确无误,并建议在隐私政策或算法说明页面显著位置展示,便于用户查询。同时,建立内部备案变更管理流程,确保算法更新后30日内重新备案。

结论与启示

合规建议与对网易的借鉴价值

本次更新是支付宝对新增AIGC算法(视频生成、音乐生成)的首次备案公示,属于实质性合规动作,反映了企业积极落实《生成式人工智能服务管理暂行办法》的备案要求。整体合规设计处于行业领先水平,技术细节披露充分,但内容安全、知识产权、用户输入过滤等风险控制措施未在公示中体现,存在完善空间。法务团队应在30天内:1)审查内部AIGC算法是否完成备案,未备案的尽快启动;2)在算法公示中补充内容安全过滤机制和版权声明;3)建立算法变更备案流程,确保重大更新及时报备。

生成于 2026/5/24 15:20:58

逐字对比

上个版本发布日期
2025年12月29日
当前版本发布日期
2026年5月8日
⋯ 折叠 21 行未变更内容 ⋯
22| 算法目的意图 | 通过智能生图算法,完成高质量、有艺术性的图像效果生成,提升C端用户参与度等。 |22| 算法目的意图 | 通过智能生图算法,完成高质量、有艺术性的图像效果生成,提升C端用户参与度等。 |
23| 备案编号 | 网信算备330106616449901240021号 |23| 备案编号 | 网信算备330106616449901240021号 |
·24| | |
·25| --- | --- |
·26| 算法名称 | 支付宝视频生成算法 |
·27| 算法基本原理 | 基于时空扩散模型(Spatio-Temporal Diffusion Model)和多模态融合技术,该算法能够接收文本、单张或多张图像作为输入, 生成高保真度的动态视频。其核心是利用一个大型的Transformer架构,在潜空间(Latent Space)中学习视频数据在空间(画面内容)和时间(运动变化)上的联合分布。模型通过在巨大的视频-文本-图像数据集上进行预训练,理解语义、风格和动态变化规律,并在生成时通过迭代去噪过程,将随机噪声逐步精炼成符合用户输入条件的、连贯的视频片段。 输入模态:文本和图像;输出模态:视频 |
·28| 算法运行机制 | 该算法是一个复杂的、异步执行的多模态生成系统,其运行机制可分解为以下核心步骤: 1. 多模态输入解析与编码: 文本(Prompt)输入:接收用户的文本描述(prompt)和负向提示(negative\_prompt),通过一个文本编码器(如 CLIP Text Encoder)将其转换为语义向量。 图像(Image)输入:接收用户上传的图像(images或img\id),通过一个图像编码器(如 CLIP Vision Encoder)将其转换为视觉特征向量,用于初始化视频内容、定义角色或指定整体风格。 * 控制参数解析:解析camera\movement、movement\amplitude、style 等控制参数,将其转换为引导信号,用于在生成过程中精确控制镜头动态和视觉风格。 2. 核心视频生成(潜空间扩散去噪): * 将编码后的文本向量、图像特征和控制信号进行融合,作为扩散模型的条件输入。 * 在潜空间中,模型从一个符合目标分辨率和时长的随机噪声张量开始。 * 在多个时间步(timestep)上迭代地预测并去除噪声,每一步都依据融合后的条件信号进行引导,逐步生成清晰、连贯的视频潜空间表示。 3. 视频解码与后处理: * 将最终去噪完成的视频潜空间表示通过一个视频解码器(Decoder VAE),还原成像素级别的视频帧序列。 * 音频合成(可选):如果audio为true,则调用一个文本到语音(TTS)模型,使用prompt作为文本和指定的voice\id,生成同步的旁白或音效,并将其与视频流合并(Muxing)。 任务状态管理:整个过程作为后台异步任务执行,并通过task\_id 和state(queueing, processing, success/failed)向用户反馈处理进度。 输出:任务成功后,生成带有可选水印(watermark)的最终视频文件,并提供访问链接。 |
·29| 算法应用场景 | 该算法凭借其强大的文本/图像到视频生成能力和丰富的可控性,适用于广泛的创意场景: * AIGC 内容创作:个人快速生成富有创意的视频/Vlog 片段、多媒体内容、动态表情包和视觉故事。 |
·30| 算法目的意图 | 通过提供一个高度可控、多模态驱动的智能视频生成服务,实现以下核心目标: 降低创作门槛:使不具备专业视频制作技能的普通用户,也能通过简单的文本或图片输入,创作出具有专业水准的视频内容,赋能个体创作者。 提升生产效率:将传统数小时甚至数天的视频制作流程缩短至分钟级别,实现内容生产的规模化和自动化。 |
·31| 备案编号 | 网信算备330106616449901260079号 |
·32| | |
·33| --- | --- |
·34| 算法名称 | 支付宝音乐生成算法 |
·35| 算法基本原理 | 支付宝音乐生成算法能够基于用户上传的文本、图片等信息,使用基于深度学习的大语言模型和扩散模型算法,结合用户输入的提示词指令完成音乐及歌词生成。 |
·36| 算法运行机制 | 用户输入提示词文本(或上传图片)后,符合要求的请求会进入意图识别模块,采用大语言模型识别用户的具体生成意图,并生成相应风格和需求的歌词及曲风描述文本;随后歌词和曲风描述文本会经过音乐生成模型,生成相应的音乐,包含人声对歌词的演唱及背景伴奏乐;最后,返回音乐和歌词,显示到用户界面。 具体包括: 文生音乐和图生音乐:1)基于上述生成的歌词和歌曲描述文本,通过文本token化,基于全新的扩散模型,完成文/图生成 音乐的过程;2)输入模态:文本(文生音乐)或文本加图像 (图生音乐);3)输出模态:音乐/音频 歌词生成:1)基于用户上传的意图提示词文本和/或图像,通过大语言模型判断意图,并生成相应的歌词文本和歌曲风格描述文本;2)输入模态:文本和或图像;3)输出模态:文本 |
·37| 算法应用场景 | 算法应用于人工智能相关应用产品文生音乐/图生音乐场景。 |
·38| 算法目的意图 | 根据用户指令为用户基于个人学习、研究、欣赏、娱乐等需求提供专业的内容和服务,实现文生音乐、图生音乐等音乐生成类任务。 |
·39| 备案编号 | 网信算备330106616449901260087号 |
24三、大模型原理说明40三、大模型原理说明
25灵光使用的通用大模型信息如下:41灵光使用的通用大模型信息如下:
⋯ 折叠 16 行未变更内容 ⋯
已折叠未变更段落 · 点击右上「全文对比」查看完整两版