聚类 技术
聚类在无标签数据上把相似样本分组(簇内相似、簇间相异),K-means、层次聚类、DBSCAN 为经典算法,用于客户分群、图像压缩与异常检测。
大模型 · 万物互联 · 人工智能的结构化知识库。人人可阅读、可贡献、可追溯。
聚类在无标签数据上把相似样本分组(簇内相似、簇间相异),K-means、层次聚类、DBSCAN 为经典算法,用于客户分群、图像压缩与异常检测。
回归预测连续值输出,是最基本的监督学习任务:线性回归、岭回归、决策树回归与神经网络均可,评估用 MSE/MAE/R²,广泛用于价格、销量与指标预测。
自监督学习从数据自身构造监督信号(掩码预测、对比、旋转预测)进行预训练,无需人工标注,是 BERT、GPT、CLIP、ViT 等大规模预训练的基础范式。
半监督学习同时利用少量标注与大量无标注数据提升性能,假设为平滑/聚类/低密度,方法包括伪标签、一致性正则(FixMatch)与图传播,标注成本效益显著。
无监督学习在无标签数据上发现结构(聚类、降维、密度估计、关联规则),是探索数据与预训练的基础,K-means、PCA、自编码器与对比学习为其代表。
监督学习用带标注的「输入-输出」样本学习映射函数,是机器学习最主要的分支,覆盖分类与回归,代表算法有线性模型、决策树、SVM、神经网络与梯度提升。
边缘检测提取图像中灰度突变的轮廓(Canny、Sobel 为经典算子,HED/学习型方法更强),是分割、检测与特征提取的底层预处理,也是 ControlNet 的常见条件输入。
特征点检测在图像中找稳定可复现的关键点并生成描述子(SIFT、ORB、SuperPoint),用于匹配、拼接、定位与三维重建,是传统视觉的基石。
图像配准把不同时间/视角/模态的图像对齐到同一坐标系,分特征法与强度法(及深度学习),是医学影像融合、遥感拼接与三维重建的关键步骤。
图像检索按内容查找相似图像(以图搜图),核心是提取紧凑判别特征(全局描述子)+ 近似最近邻检索,深度模型与哈希编码是主流,用于电商与版权检测。
场景理解是 CV 的综合任务:同时解析场景的物体、布局、深度、关系与语义(识别+检测+分割+深度+关系),是自动驾驶与机器人感知的终极目标之一。
行为识别从视频中判断动作类别(跑步、挥手等),双流/3D CNN/时空注意力是主流架构,Kinetics 与 UCF101 为标准基准,是视频理解的核心任务。
光流估计计算相邻帧每个像素的运动向量,是视频理解、插帧与 SLAM 的基础,方法从 Lucas-Kanade/传统优化到 CNN(FlowNet、RAFT),RAFT 是精度标杆。
图像修复填补图像缺失/被遮挡区域,使其与周围语义一致,从扩散/偏微分方程方法演进到 CNN 与扩散模型(LaMa、Stable Diffusion inpaint),用于去水印、旧照修复。
图像去噪从含噪声图像恢复干净图像,方法从滤波(BM3D)到 CNN(DnCNN)与扩散模型,是图像恢复的基础任务,评估用 PSNR/SSIM,DND、SIDD 为真实噪声基准。