智东西
作者 | 江宇
编辑 | 漠影
智东西1月30日报道,今日,来自生数科技的AI***模型Vidu Q3 Pro登上国际权威AI基准平台Artificial Analysis榜单,位列中国第一,全球第二。
这是最新榜单内,首个打入国际第一梯队的国产***生成模型。
它仅次于马斯克旗下xAI的Grok,领先于Runway Gen-4.5、Google Veo 3.1和OpenAI Sora 2。
▲国际权威AI基准平台Artificial Analysis最新榜单
而这项排名的背后,是国产AI***生成技术迈出的关键一步——模型已经突破“能出画”的门槛,具备“会讲故事的导演感”。
在这个***都能把文字变成***的阶段,看似创作门槛降低了,真正想做出一条有情绪、有节奏、有表达的短片,却依然难度不小。
最常见的问题有三:
一是静音哑片,不能同步输出声音,画面与音效相对割裂;
二是镜头语言单一、节奏缺失,难以表达复杂情绪;
三是文字缺席,没有文字,台词、字幕、广告语全靠后期补救。
它们分别卡在AI生成***环节的不同节点,直接限制了AI***模型从生成工具走向内容创作引擎的能力。
如今,这个缺口正被Vidu Q3填补。新一代***生成模型Vidu Q3,完成了三项关键突破:全球首个支持16s音***直出的模型、镜头自由切换控制、画面内精准文字渲染——声音、镜头、语言三者齐发。
它不仅能讲出完整的台词、控制好节奏,还能直接在画面中“写”下表达,具备导演级的调度能力,专门为“剧”而生。
自此,一款具备“导演感”的AI***生成模型来了。
一、从“生成***”到“调度镜头”,三块短板正被补上
对很多AI***创作者来说,“把画面做出来”已经不是问题,难的是“怎么让它讲得通顺、看得下去”。
这次,Vidu Q3升级为一款将声音、镜头、节奏与字体渲染打包生成的创作引擎,具备更接近专业导演的视听表达能力,开始补上AI***创作长期缺失的三块关键能力:
首先,是音画同步这一技术难题的突破,让AI***终于能“讲完整的话”了。
Vidu Q3支持最长16秒的音***一体生成,语音、旁白、对话、音效和音乐可以同步输出,还能精准对口型。
目前,该模型已覆盖中文、英文、日文,是全球首个在这一时长内实现高质量声画同出的生成模型。
其次,镜头调度不再呆板,开始具备戏剧张力。
Vidu Q3能够根据内容自动切换镜头视角,从远景到特写,不同情绪、动作、节奏的变化都能驱动镜头语言的调整,模拟专业导演的调度方式,让AI生成的故事更有视觉语言,而不只是“画在动”。
最后,长久困扰生成***的文字渲染问题也得到解决。
Vidu Q3可直接在画面中生成中、英、日三种语言的文字内容,支持广告语、环境标识等多种文字场景自然融入画面,无需再靠贴图拼接,整体排版风格统一,省去了大量后期工作。
当这三块短板被补上后,AI***的表达力开始具备“讲故事”的能力,而不再只是片段的拼贴。
二、实测体验:我们让AI“导”了一支16秒短片
我们设定了一个国漫风格的创意场景,测试Vidu Q3是否能够在“导演视角”下同时调度语音、镜头与画面文字。
提示词:深山竹林中,一男一女两位剑客正在对峙。男性剑客(声音沉缓):“真的没有挽回的余地了吗?”镜头切至女性剑客特写,她一身红衣,嘴角挑起一抹不屑的冷笑。女性剑客(语气桀骜):“你我二人早已恩断义绝,看招!”她身形如闪电般窜出,两人剑光交错,招式行云流水,剑刃碰撞的清脆铮鸣与古风鼓点交织,在竹林间激荡出凌厉的交锋节奏。背景叠加古风氛围音乐以及冷兵器碰撞摩擦的声音。
提示词:深山竹林中,一男一女两位剑客正在对峙。男性剑客(声音沉缓):“真的没有挽回的余地了吗?”镜头切至女性剑客特写,她一身红衣,嘴角挑起一抹不屑的冷笑。女性剑客(语气桀骜):“你我二人早已恩断义绝,看招!”她身形如闪电般窜出,两人剑光交错,招式行云流水,剑刃碰撞的清脆铮鸣与古风鼓点交织,在竹林间激荡出凌厉的交锋节奏。背景叠加古风氛围音乐以及冷兵器碰撞摩擦的声音。
整体观感上,本次生成节奏自然,镜头切换清晰,角色对白与口型匹配度较高,画面构图和氛围也较为协调,基本还原了古风剑客对峙的场景。
进一步观察细节,不同镜头间的切换能够精准对应动作转换节点,剑光交错、人物移动与镜头运转的节奏保持一致,未出现跳帧、错位等干扰体验的问题。
背景音乐层次分明,冷兵器碰撞声与角色台词均有良好呈现。
在实际生成过程中,出片效率较高,画面渲染稳定,交互过程清晰。用户可通过提示词对人物对白、画面风格、动作节奏等多维度进行控制,可控感明显提升。
综合来看,Vidu Q3已具备基础的“导演感”,能够胜任短剧创作、影视剧情、广告营销等多种场景。
三、能拍短剧、能出广告、也能做动漫,内容创作的地基在悄悄重构
当***生成开始承担内容生产的完整链条,我们看到的几个实际应用方向,已经能串起从剧本到出片的全过程。
通过声音、动作与镜头的协同生成,Vidu Q3能够还原较为复杂的情节表达,支持分镜与情绪变化,是目前较为适合叙事类创作的应用方向之一,可以被用于制作短剧、漫剧等故事内容。
与此同时,在广告与产品展示场景中,自动出片能力也显著提升了创作效率。
该模型适合带解说的产品***、人物出镜介绍等形式,“语音+镜头”联动生成,免去了“脚本-拍摄-剪辑”的多轮反复。
此外,Vidu Q3也在自媒体和播客等轻制作领域展现出较强的实用性。
Vidu Q3支持风格设定与人物设定,搭配对白和动态镜头,让播客或短***内容也具备足够好的观看体验,且能够批量生产。
作为新一代专门为“剧”而生的***模型,Vidu Q3的目标用户就不止是内容创作者,还有广告人、营销人、产品人,创作角色也正在被重新定义。
结语:“导演感”落地了,AI***进入工业级内容生产新阶段
短短一年时间,AI***的生成能力完成了从“能动”到“会讲”的关键跨越。
Vidu Q3同样是一种创作方式的升级:从声音、画面、镜头到字幕,它把一个***创作的完整能力交到创作者的手里。
无论是叙事驱动的短剧、新意爆棚的广告、风格鲜明的动漫,还是自媒体***等多个领域,AI都正在转向一位合格的创作伙伴。
如果说之前的AI***模型还像是“摄像机”,那么现在,它开始像个真正的“导演”了。
接下来,它还能讲出怎样的故事,也值得我们继续期待。返回搜狐,查看更多
影石年会送房,影视飓风Tim也来了_Pro_台影翎_奖品...
100万颗卫星+AI,马斯克要在太空做什么_部署_近地轨道_SpaceX...
马斯克大动作!SpaceX申请部署100万颗卫星!重磅数据,首次曝光_公司_人士_特斯拉...
马斯克:暂时搁置火星***,重点转向建造月球城市_SpaceX_登陆_与美国...
AI相关产品如HBM与DDR5,单价、利润率远超消费级DDR4和NAND Flash,所以AI需求的突然爆发,直接驱动了一场存储产能的结构转变。 经过前期的疯狂上涨,内存价格目前已经来到了历史极高水平,但AI…...
美团50亿元“收编”叮咚买菜,值吗?_零售_收购_业务...
毕竟赵露思刚刚在去年十月凭借《许我耀眼》这部剧收割了一波下沉市场的流量,赵露思逆风翻盘的阶段性经历也都成为短***洪流源泉,从上文分析可以看出,这一次赵露思打出助农名义,真实对话下沉市场农民与生活,奏效明显,…...
腿脚利索能跑的,就去跑个马拉松,顺手拿个全球首个人形机器人半马冠军; 弹跳力稍微好点的,就去报名运动会,轻松整一个「全球首个跳高冠军」的头衔回来;哪怕是只能在家里干干家务的,高低也得给自己安一个「全球首个家…...
苹果2026爆发式更新:换模Mac、重塑iPhone形态,为下一个十年铺路?_Pro_芯片_Studio...
从“让图动起来”到“让AI会拍片”,二代AI***模型的进化,不仅是创作者的效率革命,更预示着对内容创作行业的冲击真的来了。吴杰茜也表示,AI***生成模型从诞生之初,就对***自媒体、动画媒体、影视行业的创作者…...
手机卷不动了,机圈都开始搞跨界,谁能干成第二个 “ 小米 ” ?_vivo_产品_胡润...
记者从中国时空获悉,基于中国时空服务能力,中国移动、中国电信、中国联通均已推出北斗短信业务,不仅为应急通信、户外出行、日常联络筑牢安全防线,更广泛赋能健康服务、养老服务、儿童保障等多元民生场景。2024年1…...
一年时间,“AI六小虎”的分化早已给出答案:在巨头阴影下,AI创业公司想要生存,要么像阶跃星辰那样精准卡位细分赛道、稳扎稳打;要么像智谱AI那样借力资本、冲刺上市;要么像月之暗面那样坚守技术、打造差异化;而…...
刚刚!AI大牛股,重磅发布!四大创新来袭,多家国产芯片“入列”_智谱_模型_编程...
小米汽车2026年1月交付量超过39000台_雷军_直播_参考...
这种方式,一方面大幅降低了下游用户灵活使用算力的门槛,尤其有利于众多 AI 初创企业快速开展产品研发与落地应用,特别是中小企业,由于资金和技术限制,更倾向于通过租赁方式获取算力***,这为算力租赁市场提供了广阔…...
与加尔戈蒂亚斯大学这架由泡沫板、锡纸和胶带拼凑的“手工课作业”形成鲜明对比的是,中国无人机产业已发展成为全球无可争议的领导者。这不仅展示了卓越的飞控技术和动力系统,更证明了其在高海拔军事侦察、目标定位、物资…...
几天前,结合相关消息,特斯拉已经在美国和加拿大率先停用了Autopilot,未来这两个地区的用户在购车时,只能选择付费订阅FSD。 而站在特斯拉的角度,这套智驾系统无疑将是2026年能否逆风翻盘,至关重要的…...
经过持续五年多的化石挖掘***集和分析研究工作,近日,由中国科学院南京地质古生物研究所(以下简称“南京古生物所”)与湖南省博物馆、中国地质调查局成都地质调查中心、南京大学、贵州大学、临沂大学等单位科研人员合作的相…...
以百度智能云携手峨眉山文旅打造的“AI财神”为例,其之所以引发广泛关注、登上微博热搜,核心原因是其更具***感的服务体验:一方面是源头真,人们对话的AI财神,其IP形象依托峨眉山“华夏第一正财神”赵公明构建;…...
在斯坦福期间,姚顺宇研究量子引力和量子信息扰乱(quantum scrambling),这是理论物理中最前沿、也最抽象的领域之一。 我个人认为,姚顺宇在Anthropic积累的强化学习经验,以及他作为物理学…...
网约车监管信息交互系统发布的行业数据显示,聚合平台与自营平台在车辆的合规率上有较大差异。据弗若斯特沙利文的资料,通过聚合平台履行的网约车订单占比由2019年的7.0%增至2024年的31.0%,预计到2029…...
在面对这些机遇和挑战时,我们应该以开放包容的态度,理性客观地看待,既要充分认识到其积极影响,也要警惕其消极影响,***取有效的监管和教育手段,推动性知识的健康传播,让用户能够在成人内容网站中,获取到有益的性知识,…...
宇树CEO王兴兴:当前机器人技术接近10岁孩子水平,大规模应用或需3至5年,最长不超10年_醉拳_科技_节目...
粤IP*******|网站地图粤IP*******|网站地图 地址: 备案号: