腾讯混元AI视频

腾讯自主研发的大规模AI视频生成模型,130亿参数开源,支持文生视频和图生视频

深度报告

  • 腾讯混元AI视频是腾讯公司自主研发的大规模视频生成模型,于2024年12月正式发布,2025年3月开源图生视频功能。该模型采用DiT(Diffusion Transformer)架构,拥有130亿参数,是当前参数规模最大的开源视频生成模型。模型支持文生视频、图生视频、视频风格化等功能,最长可生成16秒、2K高清视频。个人用户可通过腾讯元宝APP每日免费体验,企业用户可通过腾讯云API调用。这是一款同时具备开源生态和商业化应用的国产AI视频生成工具,在多项性能指标上优于Runway等国际竞品。

  • 腾讯混元AI视频由腾讯公司旗下的混元大模型团队开发和运营。腾讯混元大模型是腾讯全链路自研的通用与多模态大模型家族,覆盖图像、3D等模态,面向内容生产、业务自动化等场景提供企业级服务。 2024年12月,腾讯正式发布混元文生视频模型并宣布开源,总参数量达到130亿,刷新了开源视频模型的参数纪录。2025年3月,腾讯进一步开源了图生视频功能。2025年11月,腾讯发布并开源HunyuanVideo 1.5版本,参数为8.3B的轻量级版本,可在消费级GPU上运行。2025年9月,腾讯云正式推出API技术服务,面向企业用户提供商业化调用通道。 该模型的技术负责人凯撒在发布会上阐述了开源战略背后的行业思考:当前文生视频领域存在“抽卡式体验”痛点,普通用户多处于尝鲜阶段,开源与闭源模型之间存在较大的使用体验差距。腾讯希望通过开源降低使用门槛,推动行业生态发展。 人民日报、央视网、新华社、羊城排行榜等权威媒体已使用该模型制作作品,如《江山如此多娇》《山水之间》等。

  • 腾讯混元AI视频提供了丰富的视频生成能力。在核心功能方面,模型支持文生视频和图生视频两种生成模式。文生视频功能允许用户输入文本描述,系统生成符合描述的视频内容;图生视频功能支持上传单张图片并添加描述,生成5秒短片,支持2K高清画质并自动生成背景音效。 在技术参数方面,该模型支持生成最长16秒的视频,最高分辨率为2K高清,支持中英文双语输入。视频风格方面提供写实、动画、电影、黑白、赛博朋克5种基本风格。镜头控制支持14种镜头运动方式,包括固定镜头、手持摄影、拉近镜头等。该模型的特色功能是自动镜头切换,可在保持画面主角一致的情况下自动切换多视角。此外,模型采用新一代文本编码器,具有强大的语义跟随能力;3D变分编码器可确保小人脸、高速镜头等场景清晰稳定。 在使用流程上,个人用户需下载腾讯元宝APP,在“AI应用”板块的“AI视频”申请体验。企业用户可通过腾讯云API调用,访问地址为https://cloud.tencent.com/product/vclm。开发者可选择本地部署,完全免费使用开源版本,主要成本为本地部署的计算资源费用。 本地部署的硬件需求方面,生成720p视频至少需要60GB显存,推荐配置为80GB显存GPU。开源社区已开发优化版本,可将显存需求降至16GB以下。

  • 腾讯混元AI视频采用多层次的商业模式,覆盖不同用户群体。 个人用户通过腾讯元宝APP体验,每日可免费生成4个速度优先视频和2个质量优先视频。这一策略有效降低了普通用户的尝鲜门槛,让更多用户能够体验产品核心功能。 企业用户可通过腾讯云API调用,具体费用需咨询腾讯云官方。2025年9月正式推出API技术服务,为商业化应用提供便捷的接入通道。企业用户可根据自身业务需求灵活调用API,实现规模化应用。 对于开发者和技术爱好者,腾讯提供了完全开源的免费版本。代码仓库位于GitHub的Tencent/HunyuanVideo项目,模型可从Hugging Face下载。主要成本为本地部署的计算资源费用(GPU显存),对于有硬件条件的开发者来说,这一模式可以实现零成本使用。 关于生成视频的版权,说明书中指出生成视频版权归创作者所有,可用于商业用途。

  • 从平台数据来看,截至2025年11月,AIProductHub平台的访问体验次数为1997次。由于产品相对较新,用户评论数量尚处于积累阶段。 从用户实测反馈来看,该产品提供了每日免费体验额度,但生成队列等待时间有时较长,可能需要等待1小时或更长时间才能完成生成。简单视频几分钟即可生成,复杂高画质视频需要更长时间。 从性能评测对比来看,在与国内同类模型的5秒视频对比中,腾讯混元AI视频在文本对齐指标上达到61.8%,运动质量达到66.5%,视觉质量达到95.7%,均显著优于国内同类模型。 在与国际顶尖模型的对比中,腾讯混元AI视频在参数规模上具有明显优势(130亿参数,最大开源),在视频时长上表现优秀(最长16秒,Runway约10-15秒),完全开源是一大亮点。在文本对齐指标上比Runway高14.1%,运动质量比Runway高11.8%,视觉质量与Runway持平。

  • 腾讯混元AI视频的发布在行业内获得了广泛关注。有评测文章指出,该模型支持原生1080P视频生成,具备优秀的物理规律遵循和表情捕捉能力,是轻量级视频生成模型的代表作。2025年11月的发布会被视为国产AI视频模型发展的重要里程碑。 从开源战略角度,行业认为是务实之举。相比闭源模型,开源版本可以让更多开发者和中小企业参与使用,推动技术普惠化和生态建设。这一策略也有助于腾讯在AI视频领域建立技术影响力和行业话语权。 当前AI视频生成领域竞争激烈,国际上有OpenAI Sora、Runway Gen-3等,国内也有多个竞争产品。腾讯混元AI视频凭借130亿最大参数规模、开源免费策略以及腾讯生态的加持,具备差异化竞争优势。但与国际顶尖模型如Sora相比,在复杂场景的视频生成质量和创意能力上仍有差距。

  • 在技术层面,生成队列等待时间较长是用户反馈的主要痛点。由于免费额度吸引大量用户,高峰期可能需要排队等待数小时。此外,与OpenAI Sora等顶尖模型相比,在复杂场景的视频生成质量和创意能力上仍有差距。 在使用层面,本地部署的硬件要求较高(至少60GB显存),对普通用户不够友好。虽然开源社区已开发优化版本降低硬件门槛,但仍需要专业配置。 在版权方面,虽然声明生成视频版权归创作者所有可商用,但AI生成内容的版权归属在法律层面仍存在一定模糊性,建议商业使用前咨询专业法律意见。

  • 腾讯混元AI视频适合以下用户群体:内容创作者和短视频博主可通过免费额度进行尝鲜和创作;广告营销团队可利用视频生成能力制作宣传素材;影视制作团队可用于概念测试和场景预览;开发者和AI技术爱好者可参与开源社区贡献;企业用户可通过API实现规模化应用。 对于免费额度足以满足需求的个人用户,推荐先下载腾讯元宝APP体验,每日4个速度优先视频和2个质量优先视频基本够用。对于有本地部署条件的开发者,建议从GitHub获取开源版本进行深入研究。对于有规模化需求的企业用户,建议联系腾讯云了解API定价。 同类型产品中,Runway、Pika Labs、可灵AI、即梦AI等是主要的竞品选择,用户可根据具体需求进行对比试用。

  • 腾讯混元AI视频是国产AI视频生成模型的代表作,130亿参数规模、最大开源、视频质量优秀是其核心优势。免费开放的策略降低了用户使用门槛,腾讯生态的加持提供了多渠道访问方式。对于需要免费工具的内容创作者和AI爱好者,这是一个值得尝试的选择;对于有高质量视频需求的商业用户,可关注API的商业化应用进展。

用户评论

  • 头像
    Rebecca_Coleman_Max
    130亿参数的免费开源视频模型,香到飞起!国内最强应该没悬念了。

  • 头像
    JacquelineJohnson_Max
    开发者狂喜!GitHub直接下载权重,本地部署自由度更高。虽然60GB显存门槛不低,但社区已经有优化方案了,16GB也能跑。

  • 头像
    goldenduck212
    用元宝APP体验了一下,每天免费额度够玩一会儿。不过生成真的慢,高峰期要等一两个小时,建议避开晚间。

  • 头像
    DRussell_2021
    免费还要什么自行车!每天4个速度优先+2个质量优先,足够日常玩玩了。商业用途再买API。

  • 头像
    MaryMendozaK
    对比了Runway Gen-3,文本对齐和运动质量确实更强,特别是语义理解这块。能感觉出腾讯的技术积累。

  • 头像
    贾婷
    自动镜头切换这个功能太赞了,保持主角一致多视角切换,目前独一家。生成16秒2K视频,效果确实比同价位产品好。

  • 头像
    IraSaha
    跑了下本地部署,RTX 4090实测批次大小1,生成720p大概需要15分钟一顿,显存刚好够用。要求确实高但能跑。

  • 头像
    JohnnyScott_Pro537
    说实话,和Sora比还是有差距的,特别是在创意场景生成这块。但架不住免费啊,而且视频质量日常用足够了。

  • 头像
    丁博
    CSDN上有详细的部署教程,按照步骤来基本没问题。建议先玩通再考虑本地部署。

  • 头像
    iThomasLaufer_pro
    生成视频版权归属创作者,可以商用。这点很关键,比某些AI生成工具的版权模糊不清好太多。

  • 头像
    BryanBaker_2022
    支持中英文双语,这点对国内用户很友好,写实、动画、电影、黑白、赛博朋克5种风格选择也很丰富。

  • 头像
    Christopher_Bailey_X
    14种镜头运动方式,固定镜头手持摄影拉近远景都有,视频质感提升明显。电影感可以搞起来。

  • 头像
    LApet
    等太久是唯一的槽点。高峰期队列真的长,有时候要等一两个小时才能出片。腾讯该加服务器了。

  • 头像
    Jeremy_Brown007
    新一代文本编码器确实强,语义跟随能力强悍。描述稍微复杂一点的场景也能准确理解,不会有太大的偏差。

  • 头像
    AReedII363
    3D变分编码器,小人脸高速镜头这些场景清晰稳定很多。之前试过其他模型,这种场景惨不忍睹。

  • 头像
    AnnHillQ
    人民日报、央视网都在用这个模型做东西,质量应该是有保障的。官方都背书了。

  • 头像
    曾云
    Hugging Face上模型下载很方便,生态做得不错。开发者社区也很活跃,教程资源越来越多。

  • 头像
    Isabella_Jones_2024
    开源免费+腾讯生态加持,这波确实是业界良心。对比某些收费还一堆毛病的AI视频工具,混元真的业界良心。

  • 头像
    Ronald.Morales_66
    1.5版本8.3B参数,消费级GPU也能跑了,硬件门槛降低很有感。普通游戏本也能玩。