版本演变分析
由 DeepSeek 生成
本次更新从标题到内容全面重构,新增模型原理、训练数据、局限性与风险等章节,显著提升透明度与合规披露水平。
总体评估
本次版本演变的方向与定性
本次更新属于实质性扩展与厘清性调整,整体方向为大幅提升模型技术透明度与合规披露水平。旧版仅有一个标题,新版则扩展为完整的四章结构,涵盖模型基本原理、训练数据来源与治理、局限性及滥用风险、模型公示信息。关键新增包括:明确模型训练分为预训练与优化训练两个阶段,详细说明数据来源(互联网公开信息与第三方合作数据),强调不有意收集个人信息用于训练,并披露数据治理流程(过滤、去标识化、安全对齐)。此外,新增对模型局限性(幻觉)和滥用风险的说明,并赋予用户知情权、选择权和控制权。这些变化紧密对接《生成式人工智能服务管理暂行办法》关于训练数据合法性、透明度、安全评估等要求,以及《个人信息保护法》关于告知同意义务。在同业中,DeepSeek 此举处于领先水位,其开源模型背景下的透明化披露为行业提供了标杆。
详细变更点
按条款逐项的变化解读
1. 标题与引言(原标题'DeepSeek 模型公示信息'改为'模型原理与训练方法说明',并新增段落)
旧版:DeepSeek 模型公示信息
新版:杭州深度求索人工智能基础技术研究有限公司及其关联公司(以下简称“我们”或“DeepSeek”)是以探索AGI为目标的研究团队,专注于模型基础技术研究,并坚持开源路线,预期通过开放、透明、安全的理念促进技术普惠。我们通过本文来介绍和解释DeepSeek模型的基本原理和训练方法,让您详细了解DeepSeek的工作方式,帮助您更好地使用DeepSeek,并保障您在使用DeepSeek过程中的知情权和控制权。
合规影响
此变更属于实质性变化。旧版仅有一个标题,未提供任何实质信息,无法满足《生成式人工智能服务管理暂行办法》第4条关于透明度与告知的要求。新版通过详细引言,明确了披露目的(保障知情权和控制权),直接回应了监管对生成式AI服务提供者应当公开模型基本信息、训练数据来源等要求。同时,该引言将公司定位为研究团队并强调开源,有助于降低用户对数据滥用的担忧,但需注意该表述可能被解读为对模型安全性的承诺,若后续发生安全事件可能增加企业责任。从合规义务看,企业需确保后续章节内容与引言承诺一致,并保留相关披露记录以备监管检查。
借鉴价值
网易类似政策(如游戏AI助手或大模型服务说明)可以借鉴此处的做法:在开头明确披露目的,直接引用'保障知情权和控制权'等法律术语,并说明公司定位与开源理念。应规避的是过度承诺'安全',建议使用'努力保障安全'等限定性表述。
2. 第一章 模型基本原理(新增)
旧版:无
新版:目前,DeepSeek 线上提供服务的基础模型均为基于深度神经网络的大语言模型。该类模型提供服务主要分为两个阶段:训练阶段和推理阶段。同时,DeepSeek 的模型均为开源模型,因此该部分还会介绍我们的模型开源工作。
合规影响
此变更属于实质性新增。旧版未涉及模型原理,新版详细描述了训练(预训练与优化训练)和推理阶段,并强调模型采用自回归生成方式,非简单检索或复制粘贴训练数据。这直接满足了《生成式人工智能服务管理暂行办法》第4条关于'提供者应当依法承担网络信息内容生产者责任,履行网络信息安全义务'以及第6条关于'采取有效措施防止生成虚假信息'的透明度要求。通过解释模型工作原理,企业可以降低用户对输出内容准确性的不合理期待,从而减轻因'幻觉'导致的潜在责任。但需注意,该描述可能被监管视为对模型技术能力的承诺,若模型实际行为与描述不符(如存在记忆训练数据),可能构成虚假宣传。
借鉴价值
网易类似政策可以借鉴此处的做法:明确区分训练与推理阶段,并强调模型生成内容是基于概率而非复制,以降低用户对输出准确性的预期。应规避的是使用'理解'、'深度理解'等拟人化表述,建议改为'基于统计模式'等中性术语。
3. 第二章 模型训练的数据(新增)
旧版:无
新版:DeepSeek模型的能力建立在高质量、大规模且来源多样化的数据基础之上。我们高度重视并严格遵守知识产权、商业秘密和个人隐私相关的法律法规,确保所有数据的获取和使用均在合法合规的框架内进行。
合规影响
此变更属于实质性新增。旧版未涉及数据来源,新版明确预训练数据来自互联网公开信息和第三方合作数据,并声明不有意收集个人信息用于训练,但承认可能偶然包含个人信息,并采取技术手段筛查移除。这直接回应了《个人信息保护法》第6条关于最小必要原则和第13条关于合法正当必要原则的要求,以及《生成式人工智能服务管理暂行办法》第7条关于训练数据来源合法性的要求。企业需确保实际数据治理流程与描述一致,并保留数据来源合法性证明(如第三方合作协议、数据过滤日志等),以应对监管检查。此外,声明'不有意收集个人信息'但承认偶然包含,可能引发监管对'偶然'定义的质疑,建议进一步量化筛查标准。
借鉴价值
网易类似政策可以借鉴此处的做法:明确声明不有意收集个人信息,并披露数据治理流程(过滤、去标识化)。应规避的是'偶然包含'这种模糊表述,建议改为'可能包含少量个人信息,我们已通过自动化与人工审核相结合的方式尽力移除'。
4. 第三章 模型的局限性和风险(新增)
旧版:无
新版:人工智能模型可能由于两方面原因导致风险:1.因人工智能技术发展不够成熟而无法避免的局限性;2.因人工智能技术滥用而导致的风险。具体来说:1.局限性...模型生成的内容仅供您参考,您不应将输出的内容作为专业建议。2.滥用风险...DeepSeek非常重视人工智能技术在应用中可能产生的风险。我们严格遵循法律法规的合规要求,采取了合理的措施不断加强模型的安全性...同时,为了缓解人工智能可能导致的风险,我们赋予用户广泛的权利...
合规影响
此变更属于实质性新增。旧版未涉及风险披露,新版详细说明了局限性(幻觉)和滥用风险,并明确声明输出内容仅供参考,不构成专业建议。这直接满足了《生成式人工智能服务管理暂行办法》第4条关于'提供者应当依法承担网络信息内容生产者责任'以及第9条关于'采取有效措施防范未成年人用户沉迷'等要求。通过明确免责声明,企业可以降低因用户依赖输出内容导致损失而引发的民事赔偿责任风险。同时,赋予用户知情权、选择权和控制权,符合《个人信息保护法》第44条关于个人在个人信息处理活动中的权利。但需注意,免责声明不能免除因故意或重大过失导致的侵权责任,且需确保用户能够实际行使所宣称的权利(如删除历史数据)。
借鉴价值
网易类似政策可以借鉴此处的做法:明确列出模型局限性(如幻觉)并附免责声明,同时列举用户权利(知情权、选择权、控制权)及行使方式。应规避的是'不构成任何建议或承诺'这种绝对化表述,建议改为'不构成专业建议,请结合自身情况判断'。
结论与启示
合规建议与对网易的借鉴价值
本次更新整体合规启示有三:一是生成式AI服务提供者必须大幅提升透明度,详细披露模型原理、训练数据来源及治理措施,以符合《生成式人工智能服务管理暂行办法》的透明度要求;二是必须明确告知模型局限性并附加免责声明,以降低因输出内容不准确导致的民事风险;三是应赋予用户充分的权利(知情权、选择权、控制权)并明确行使路径,以对接《个人信息保护法》的个人权利条款。与监管最新口径高度契合,在同业中处于领先水位,尤其是开源模型背景下的透明化披露为行业树立了标杆。法务团队接下来30天内需:1)复审现有AI产品政策,确保包含类似透明度章节;2)补充数据治理流程的书面记录(如过滤日志、第三方合作协议);3)在用户协议中增加免责声明条款,并确保用户权利行使渠道畅通。
逐字对比
| 1 | DeepSeek 模型公示信息 | 1 | 模型原理与训练方法说明 |
| · | 2 | 杭州深度求索人工智能基础技术研究有限公司及其关联公司(以下简称“我们”或“DeepSeek”)是以探索AGI为目标的研究团队,专注于模型基础技术研究,并坚持开源路线,预期通过开放、透明、安全的理念促进技术普惠。我们通过本文来介绍和解释DeepSeek模型的基本原理和训练方法,让您详细了解DeepSeek的工作方式,帮助您更好地使用DeepSeek,并保障您在使用DeepSeek过程中的知情权和控制权,防范因不当使用模型而导致的风险。 | |
| · | 3 | 关于我们如何收集、保护和使用个人信息的具体规则,请您仔细阅读《DeepSeek 隐私政策》。 | |
| · | 4 | 一、DeepSeek 模型的基本原理 | |
| · | 5 | 目前,DeepSeek 线上提供服务的基础模型均为基于深度神经网络的大语言模型。该类模型提供服务主要分为两个阶段:训练阶段和推理阶段。同时,DeepSeek 的模型均为开源模型,因此该部分还会介绍我们的模型开源工作。 | |
| · | 6 | 1.模型训练 | |
| · | 7 | 模型训练阶段即模型的开发阶段,在这阶段,开发人员通过设计好的训练方法开发出可被部署使用的模型。模型由多层神经网络组成,包含数十亿至数万亿参数,这些参数在训练过程中通过梯度下降算法持续优化。模型训练一般可以分为预训练和优化训练两个环节。 | |
| · | 8 | 预训练:预训练目标是通过数据训练模型,使模型掌握通用的语言理解与生成能力。模型在预训练阶段通过大规模自监督学习,从文本数据中学习语言模式与知识关联。预训练完成后,模型能理解并生成连贯的文本,但还不会精准地回答问题或执行任务,因此需要进一步的训练调整。 | |
| · | 9 | 优化训练:优化训练也称为微调,是在预训练模型的基础上通过特定任务的数据进一步调整模型参数,使模型适应实际应用场景。模型在优化训练阶段一般通过有监督的微调(SFT)或强化学习(RL)等方法,学会根据指令回答问题,符合人类的偏好和需求,并激发在特定领域的专业能力。经过优化训练的模型能更好地满足实际需求,可被部署使用。 | |
| · | 10 | 2.模型推理 | |
| · | 11 | 模型的推理阶段即模型被部署提供服务。模型训练完成并被部署后,可以通过对输入信息进行编码和计算来预测下一个词元,从而具备文本生成和对话等能力,其能够熟练执行基于文本生成的广泛的不同任务,并可以集成到各种下游系统或应用中。具体到DeepSeek的产品服务,模型基于用户输入信息,通过计算推理输出相应的内容作为响应,包括文字、表格和代码等。 | |
| · | 12 | 需注意的是,模型采用自回归生成方式,基于输入的上下文内容,通过概率计算预测最可能接续的词汇序列。此过程并非简单检索或“复制粘贴”模型训练数据中的原始文本,模型也并未存储用于训练的原始文本数据副本,而是模型基于对语言结构和语义关系的深度理解,动态生成符合语境的回答。 | |
| · | 13 | 3.模型开源 | |
| · | 14 | DeepSeek始终坚持模型开源。为此,我们通过开源平台对外公开发布了所有模型的权重、参数以及推理工具代码等,并适用宽松的MIT协议,供使用者自由、免费下载部署使用。同时,DeepSeek 发布各模型的完整技术报告,供社区和研究人员参考,并帮助公众更深入地了解每个模型的技术原理和细节。 | |
| · | 15 | 二、DeepSeek 模型训练的数据 | |
| · | 16 | DeepSeek模型的能力建立在高质量、大规模且来源多样化的数据基础之上。我们高度重视并严格遵守知识产权、商业秘密和个人隐私相关的法律法规,确保所有数据的获取和使用均在合法合规的框架内进行。 | |
| · | 17 | 1.预训练阶段 | |
| · | 18 | 在模型预训练阶段,需要获取语料数据用于训练,此阶段主要使用以下两个类别的数据用于训练:(1) 互联网上公开可用的信息,(2) 我们与第三方合作获取的信息, | |
| · | 19 | 模型预训练阶段无需获取个人信息用于训练,因此我们不会有意收集个人信息以关联至任何特定的账户或个人,也不会主动将其用于训练我们的模型。但由于预训练所需数据规模庞大,部分在线公开内容或来自其他提供方的许可数据可能会偶然包含个人信息,我们会通过技术手段尽力筛查并移除训练数据中包含的个人信息,并在用于训练前进行测试验证。 | |
| · | 20 | 此外,为了确保数据的质量、安全与多样性,我们建立了一套严格的数据治理流程。首先,我们会通过过滤器自动筛查并移除包含仇恨言论、色情低俗、暴力、垃圾信息以及可能侵权的原始数据。其次,我们认识到大规模数据集中可能存在固有的统计性偏见,因此我们通过算法与人工审核相结合的方式,尽力识别和减少这些偏见对模型价值观的影响,以提升模型的公正性。 | |
| · | 21 | 2.优化训练阶段 | |
| · | 22 | 在模型优化训练阶段,我们一般需要通过人工或自动化的方式构造、标注一批问答对数据来对模型进行训练,这些问答对数据是由我们的研究团队生产提供的,其中少部分数据的构造可能会基于用户的输入。如涉及利用用户的输入构造训练数据,我们会对数据进行安全加密技术处理、严格的去标识化和匿名化处理,尽可能使其无法关联到任何特定个人,且不会在模型给其他用户的输出中带有个人信息,更不会将其用于用户画像或个性化推荐。同时,我们为用户提供了选择退出的权利。 | |
| · | 23 | 为了确保模型的安全性,在模型优化训练阶段,我们会构造专门的安全数据对模型进行安全对齐,教会模型的回复符合人类的价值观,增强模型内生的安全能力。 | |
| · | 24 | 三、模型的局限性和风险 | |
| · | 25 | 人工智能模型可能由于两方面原因导致风险:1.因人工智能技术发展不够成熟而无法避免的局限性;2.因人工智能技术滥用而导致的风险。具体来说: | |
| · | 26 | 1.局限性 | |
| · | 27 | 当前,人工智能仍处于早期阶段,技术发展尚不成熟。受限于当前模型的技术原理,人工智能可能生成错误、遗漏或不符合事实的内容,这一现象被称为“幻觉”。幻觉是当前人工智能产业所共同面临的挑战。DeepSeek致力于通过研究降低模型的幻觉率,包括但不限于选取高质量的训练数据源、优化对齐的策略、通过检索增强生成(RAG)技术等,但现阶段我们无法保证模型不产生幻觉。为了进一步降低幻觉可能导致的不利后果,我们在DeepSeek的欢迎页、生成文本的末尾以及交互界面的底部添加显著的提示标识,特别提醒用户内容由人工智能生成,可能不准确。 | |
| · | 28 | 因此,模型生成的内容仅供您参考,您不应将输出的内容作为专业建议。特别的,当您在使用本服务咨询医疗、法律、金融及其他专业问题时,请注意本服务不构成任何建议或承诺,不代表任何专业领域的意见。若您需要相关专业服务,应咨询专业人士,并在专业人士的指导下作出决策。本软件的输出不应成为您进一步作为或不作为的依据。 | |
| · | 29 | 2.滥用风险 | |
| · | 30 | 人工智能技术被滥用的风险在全球范围内被广泛关注,包括隐私保护、版权、数据安全、内容安全、偏见歧视等。模型技术本身是中立的,其风险产生于技术的实际应用中,需要与应用场景和预期目的相结合。 | |
| · | 31 | DeepSeek非常重视人工智能技术在应用中可能产生的风险。我们严格遵循法律法规的合规要求,采取了合理的措施不断加强模型的安全性,贯穿模型研发、训练、部署的全生命周期,包括但不限于制定内部风险管理制度、开展模型安全性评估、进行红队测试、增强模型和服务透明度等。 | |
| · | 32 | 同时,为了缓解人工智能可能导致的风险,我们赋予用户广泛的权利,包括但不限于用户对模型技术和服务的知情权、选择权和控制权,用户可以查询服务的基本信息、拒绝其数据用于模型训练、删除其历史数据等。如果您对相关法律赋予的权利的行使,有任何主张、要求或者疑问,可以通过查看我们的隐私政策或通过【privacy@deepseek.com】与我们联系。 | |
| · | 33 | 四、模型公示信息 | |
| 2 | DeepSeek的模型与算法备案公示情况如下: | 34 | DeepSeek的模型与算法备案公示情况如下: |
| 3 | | | | | | | 35 | | | | | | |
| ⋯ 折叠 5 行未变更内容 ⋯ | |||