视频生成 概念
视频生成指用模型合成全新视频内容,覆盖文生视频、图生视频、视频编辑与预测(world model),2023–2024 年从研究走向商用,Sora、可灵、Veo 为代表。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
视频生成指用模型合成全新视频内容,覆盖文生视频、图生视频、视频编辑与预测(world model),2023–2024 年从研究走向商用,Sora、可灵、Veo 为代表。
StyleGAN 是 NVIDIA Karras 团队提出的人脸/肖像生成 GAN,通过「风格向量注入 + 渐进生成 + 解耦」实现高质量、可插值、可控性极强的高清人脸生成(2019–2021)。
生成对抗网络(GAN)由 Goodfellow 等 2014 年提出:生成器与判别器相互博弈,生成器学真实数据分布以骗过判别器,是图像生成、超分与风格迁移的重要范式,后逐渐被扩散模型取代。
神经辐射场(NeRF)用多层感知机建模三维场景的「位置+视角→颜色+密度」映射,从稀疏多视图照片重建可任意视角渲染的新视图,是三维视觉与新型渲染的里程碑(2020)。
风格迁移把参考图像的风格(笔触、配色、质感)应用到内容图像,Gatys 等(2015)以 VGG 特征层的 Gram 矩阵开创神经风格迁移,现已演进到任意风格与扩散模型版本。
ControlNet 是张吕敏等人提出的可控生成方法(2023):通过可训练条件分支把边缘、深度、姿势、涂鸦等结构条件注入冻结的 Stable Diffusion,实现精确的结构控制生成。
图像编辑指用指令/掩码/参考图修改图像的属性、内容或风格,基于扩散模型的指令编辑(如 InstructPix2Pix、IP-Adapter、局部重绘)已取代传统手工修图成为主流。
文本到图像(Text-to-Image)是根据自然语言描述生成对应图像的生成任务,核心是让文本语义精确控制图像内容,DALL-E、Stable Diffusion、Imagen、Midjourney 为代表系统。
DALL-E 是 OpenAI 的文生图模型系列:DALL-E 1(2021)以离散 VAE+自回归 Transformer 开创文本生成图像;DALL-E 2(2022)改用 CLIP 引导扩散;DALL-E 3(2023)深度结合 Ch...
潜在扩散模型(LDM)在 VAE 潜空间而非像素空间执行扩散,大幅降低计算量并支持文本条件控制,是 Stable Diffusion 的底层技术(2022)。
图像生成指用模型从噪声/条件(文本、草图、掩码)合成图像的生成式 AI 技术,主流方法从 GAN 演进到扩散模型,Stable Diffusion、Midjourney、DALL-E 为代表性产品。
多模态对齐是把不同模态(文本/图像/音频/视频)的表征映射到统一语义空间的技术,是图文检索、图文生成与多模态大模型的核心机制,对比学习与交叉注意力是两大主流路线。
FLAN(Finetuned Language Net)是 Google 用大规模多任务指令集对语言模型进行微调的产物,其 FLAN-T5 变体以开源权重展示了「指令微调带来零样本能力」的普适规律。
开源大模型指公开权重(甚至训练数据)的大语言模型,以 LLaMA、Mistral、Qwen、DeepSeek、GLM 等为代表,推动了私有化部署、社区微调与学术复现,与闭源模型形成双轨生态。
多模态大模型(MLLM)指能同时理解并处理文本、图像、音频、视频等多种模态的大语言模型,以 GPT-4V、Gemini、Claude 3 为代表,是迈向通用人工智能的重要形态。