百科

大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。

学科分类

最新收录

RFID 技术

RFID(射频识别)通过无线电波非接触读写电子标签,实现物体识别与追踪,是供应链、门禁与物联网感知的核心技术,分低频/高频/超高频/微波频段,超高频用于物流批量识别。

雾计算 技术

雾计算是思科 2012 年提出的介于云与端之间的分布式计算层,利用网关/路由器等中间设备就近处理数据,是边缘计算概念的早期形态,强调层次化「云-雾-端」。

边缘智能 技术

边缘智能指在靠近数据源的边缘设备上执行 AI 推理甚至训练,通过模型压缩(量化/剪枝/蒸馏)、NPU 加速与边云协同,在带宽与隐私受限的场景实现实时智能。

CoAP 技术

CoAP 是面向资源受限物联网设备的应用层协议,基于 UDP 实现类似 HTTP 的请求/响应模型(REST),支持观察资源与组播,是 HTTP 在低功耗网络上的轻量化替代。

无线传感器网络 技术

无线传感器网络(WSN)由大量低功耗传感节点自组织组网,协作完成环境/状态数据采集与传输,是物联网感知层的基础形态,采用 ZigBee、LoRa 等低功耗协议。

语音增强 技术

语音增强从带噪/混响语音中恢复干净语音,深度学习方案(DCCRN、FullSubNet、语音扩散模型)显著超越传统谱减法,是通话、会议与 ASR 前端的必备模块。

语音情感识别 技术

语音情感识别(SER)从语音韵律与声学特征判别说话人情绪(高兴、愤怒、悲伤等),常用特征为频谱+韵律+语音学特征,模型从 SVM 演进到 CNN/Transformer 与预训练模型(wav2vec、Whisper 特征)。

视频理解 技术

视频理解指模型对视频做分类、时序定位、行为识别、问答等语义理解,VideoMAE、TimeSformer 与多模态视频大模型(Video-LLaMA、Gemini)为主要代表,支撑视频检索与内容审核。

音乐生成 技术

音乐生成指 AI 依据文本/旋律/和弦自动作曲,MusicLM、Suno、Stable Audio 2.0 为代表,技术路线涵盖符号音乐模型(Music Transformer)与音频级扩散/自回归生成,可生成带人声的完整歌曲。

文生音频 技术

文生音频(Text-to-Audio)根据文本生成音效、环境声或语音,AudioLDM、Stable Audio、ElevenLabs 为代表,采用潜空间扩散或自回归音频 token 模型(AudioGPT、MAGNeT)。

语音克隆 技术

语音克隆用少量(甚至数秒)目标说话人音频复现其音色与韵律,主要技术为零样本 TTS 与说话人编码(如 VITS-LLM、CosyVoice、OpenVoice、XTTS),商用与滥用风险并存。

语音识别 技术

语音识别(ASR)把语音信号转为文本,从 GMM-HMM 演进到端到端(CTC/Attention/Transducer),Whisper、Conformer 等达到接近人类水平,是语音助手与字幕系统的基础。

跨模态检索 技术

跨模态检索用某模态查询(文本)检索另一模态内容(图像/视频/音频),核心是把异构模态映射到统一嵌入空间按相似度排序,CLIP 与双塔模型是最常用方案。

图像描述 技术

图像描述(Image Captioning)自动为图像生成自然语言描述,从 CNN+RNN(2014)到视觉语言模型(BLIP-2、LLaVA、GPT-4V),是检验图文语义对齐的经典生成任务。

视觉问答 技术

视觉问答(VQA)要求模型基于图像内容回答自然语言问题,是评估图文理解能力的经典任务,VQA v2 基准(2017)与 VQAv2/OK-VQA 等数据集推动多模态模型迭代。

A

B

C

D

E

F

G

H

I

J

K

L

M

N

O

P

Q

R

S

T

U

V

W

X

Y

Z

#

0.1008s