国内刊号:37-1378/N
国际刊号:1671-3559
发布日期:
作者:郑冬花,叶丽珠,隋栋,黄锦涛
基金:国家自然科学基金项目(61702026);; 广东省高等教育学会项目(21GYB08);; 广州市哲学社会科学发展规划项目(2021GZGJ145);; 广东省高等学校特色专业建设项目(2020SJTSZY01);; 广东省普通高校特色创新类项目(2021KTSCX150);; 教育部高等教育司产学合作协同育人项目(202002030019)
对密度峰值聚类算法进行有效改进,计算各样本点之间的距离和各样本点局部密度,选择两者中较大的样本点作为聚类中心点,根据其余样本点与各中心点的距离设定样本点所属类别;引入K近邻算法对密度峰值聚类算法进行优化,求解各样本点的距离时只需要考虑其周围由邻近值决定的若干样本点,实现距离阈值的自动选取;根据距离矩阵计算样本点的密度,绘制决策图并选择簇内中心点,将剩余点根据密度值分配给离中心点距离最近的类;最后将K近邻-密度峰值聚类算法部署至Hadoop云计算平台,用于解决大规模数据聚类的问题。仿真结果表明,通过合理设置K近邻算法的近邻值k,K近邻-密度峰值聚类算法具有较好的大数据样本聚类性能,与常用聚类算法相比,该算法具有更高的聚类准确率和聚类效率,适用于大数据样本聚类。
来源:2022年第05期
《济南大学学报(自然科学版)》期刊编辑部