高级搜索

留言板

尊敬的读者、作者、审稿人, 关于本刊的投稿、审稿、编辑和出版的任何问题, 您可以本页添加留言。我们将尽快给您答复。谢谢您的支持!

姓名
邮箱
手机号码
标题
留言内容
验证码

一种面向数据稀缺场景的文本分类模型训练方法

徐森 邓驹骠 徐秀芳 姚善良 卞学胜 贲晛烨

徐森, 邓驹骠, 徐秀芳, 姚善良, 卞学胜, 贲晛烨. 一种面向数据稀缺场景的文本分类模型训练方法[J]. 电子与信息学报. doi: 10.11999/JEIT260365
引用本文: 徐森, 邓驹骠, 徐秀芳, 姚善良, 卞学胜, 贲晛烨. 一种面向数据稀缺场景的文本分类模型训练方法[J]. 电子与信息学报. doi: 10.11999/JEIT260365
XU Sen, DENG Jubiao, XU Xiufang, YAO Shanliang, BIAN Xuesheng, BEN Xianye. A Heterogeneous Multi-View Semantic Fusion Training Method for Text Classification in Low-Resource Scenarios[J]. Journal of Electronics & Information Technology. doi: 10.11999/JEIT260365
Citation: XU Sen, DENG Jubiao, XU Xiufang, YAO Shanliang, BIAN Xuesheng, BEN Xianye. A Heterogeneous Multi-View Semantic Fusion Training Method for Text Classification in Low-Resource Scenarios[J]. Journal of Electronics & Information Technology. doi: 10.11999/JEIT260365

一种面向数据稀缺场景的文本分类模型训练方法

doi: 10.11999/JEIT260365 cstr: 32379.14.JEIT260365
基金项目: 国家自然科学基金(62676350, 52602749, 62301473, 62322111), 江苏高校“青蓝工程”,盐城市产业创新科技支撑(工业)专项(YCBG2025201), 黑龙江省自然科学基金 (ZD2025F004)
详细信息
    作者简介:

    徐森:男,教授,研究方向为人工智能、计算机技术、数据挖掘与融合,xusen@ycit.cn

    邓驹骠:男,硕士,研究方向为人工智能,2544150359@qq.com

    徐秀芳:女,高级实验师,研究方向为人工智能、计算机技术

    姚善良:男,讲师,研究方向为人工智能

    卞学胜:男,讲师,研究方向为人工智能、数据挖掘与融合

    贲晛烨:女,教授,研究方向为人工智能、计算机技术

    通讯作者:

    徐森 xusen@ycit.cn

  • 11)https://huggingface.co/FacebookAI/roberta-base2)https://huggingface.co/distilbert/distilbert-base-uncased3)https://huggingface.co/albert/albert-base-v24)https://huggingface.co/microsoft/deberta-base
  • 中图分类号: TP181; TP391.1

A Heterogeneous Multi-View Semantic Fusion Training Method for Text Classification in Low-Resource Scenarios

Funds: The National Natural Science Foundation of China (62676350, 52602749, 62301473, 62322111), Jiangsu University Qing Lan Project, Yancheng Industrial Innovation Technology Support (Industrial) Special Program(YCBG2025201), The Natural Science Foundation of Heilongjiang Province (ZD2025F004)
  • 摘要: 现有文本分类模型在标注数据稀缺场景下性能受限,其训练过程通常依赖单一视图的弱监督学习,易受噪声干扰,且难以挖掘难例样本在其他视图中的潜在判别信息。为解决上述问题,本文提出一种基于异构多视图语义融合的文本分类模型训练方法(HMVSF)。首先,在词频视图以双聚类一致性构建聚类一致样本集并进行一次轻量更新,提升伪监督可靠性;其次,开展主题建模,自适应选择主题数,生成硬标签与软分布,引导一次难例重训以充分挖掘其主题视图潜在特征;最后,两阶段共享同一编码器,在小规模标注集上统一微调,形成不依赖于特定的预训练起点的训练流程。在DBpedia、AG News、ISEAR、SMS Spam、Subjectivity、Polarity 6个公开数据集上,基于BERT分别设置两条初始化实验路线,实验结果表明,HMVSF整体优于代表性基线与单阶段变体,低标注预算下的提升尤为显著。
  • 图  1  基于HMVSF的文本分类模型框架图(以BERT为基准模型)

    图  2  路线A下不同标注预算时各模型分类准确率

    图  3  路线B下不同标注预算时各模型分类准确率

    图  4  不同簇数对CCS-BERTIT:CLUST分类性能影响

    图  5  权重系数$ \partial $对CCS-LDA-BERTIT:CLUST分类性能影响

    表  1  数据集和聚类一致样本信息统计

    数据集训练集聚类一致样本集合测试集类别数
    DBpedia15K12K70K14
    AGNews15K11K7.6K4
    ISEAR5.4K5.2K1.5K7
    SMS Spam3.9K3.8K1.1K2
    Subjectivity7K6.9K2K2
    Polarity7.5K7.4K2.1K2
    下载: 导出CSV

    表  2  路线A下各模型的分类结果(标注预算为64)

    数据集/模型 BERT BERTIT:CLUST CCS-BERTIT:CLUST 精度增益 误差减少
    DBpedia 31.28 68.99 74.95 8% 19%
    AGNews 66.44 78.77 82.43 5% 17%
    ISEAR 18.33 26.87 29.44 9% 10%
    SMS Spam 88.34 96.62 98.45 2% 54%
    Subjectivity 86.93 87.97 90.61 3% 22%
    Polarity 65.10 66.10 70.00 6% 12%
    下载: 导出CSV

    表  3  路线B下各模型的分类结果(标注预算为64)

    数据集/模型 BERTIT:MLM BERTIT:MLM+CLUST CCS-BERTIT:MLM+CLUST 精度增益 误差减少
    DBpedia 55.87 75.86 79.82 5% 5%
    AGNews 79.44 84.43 86.07 2% 11%
    ISEAR 20.13 31.80 32.96 4% 2%
    SMS Spam 86.53 98.60 99.10 1% 36%
    Subjectivity 91.58 91.15 91.57 0% 5%
    Polarity 70.45 71.12 74.93 5% 13%
    下载: 导出CSV

    表  4  聚类一致样本的NMI对比

    数据集测试集NMI聚类一致样本NMI
    sIBK-meanssIBK-means
    DBpedia0.6950.6130.6920.632
    AGNews0.3430.1690.3270.172
    ISEAR0.1080.0420.1110.075
    SMS Spam0.0850.0790.0970.111
    Subjectivity0.1010.0550.0960.063
    Polarity0.0180.0130.0170.011
    下载: 导出CSV

    表  5  簇内平均欧氏距离对比

    数据集训练集难例样本聚类一致样本
    DBpedia5.885.09
    AGNews4.664.37
    ISEAR2.982.94
    SMS Spam2.902.81
    Subjectivity3.413.39
    Polarity3.213.20
    下载: 导出CSV

    表  6  本文模型与其他变体模型的分类性能对比(标注预算为64)

    模型/数据集DBpediaAGNewsISEARSMS SpamSubjectivityPolarity
    RoBERTa32.5865.9315.1986.1090.5554.66
    DistilBERT42.8364.8616.9286.1089.3066.53
    ALBERT50.9053.1823.9294.8982.5557.43
    DeBERTa27.4048.3714.1293.0078.2557.38
    DisB-SIB-KmeansFT73.0278.8627.2996.9591.6063.26
    RoB-SIB-KmeansFT74.4282.6432.6298.2092.0075.82
    Be-SIB-KmeansFT77.4184.6432.8898.7493.8069.82
    CCS-BERTIT:CLUST74.9582.4329.4498.4590.6170.00
    CCS-BERTIT:MLM+CLUST79.8286.0732.9699.1091.5774.93
    CCS-LDA-BERTIT:CLUST75.2886.1830.7198.4891.1071.50
    CCS-LDA-BERTIT:MLM+CLUST80.3286.4133.4499.2891.5874.96
    下载: 导出CSV

    表  7  路线A下不同结构变体模型的分类性能对比(标注预算为64)

    数据集/模型BERTCCS-BERTIT:CLUSTLDA-BERTIT:CLUSTCCS-LDA-BERTIT:CLUST
    DBpedia31.2874.9543.6875.28
    AGNews66.4482.4368.7286.18
    ISEAR18.3329.4422.0530.71
    SMSSpam88.3498.4598.5698.48
    Subjectivity86.9390.6190.5091.10
    Polarity65.1070.0069.3971.50
    下载: 导出CSV
  • [1] WANG Kunze, DING Yihao, and HAN S C. Graph neural networks for text classification: A survey[J]. Artificial Intelligence Review, 2024, 57(8): 190. doi: 10.1007/s10462-024-10808-0.
    [2] DEVLIN J, CHANG M W, LEE K, et al. BERT: Pre-training of deep bidirectional transformers for language understanding[C]. Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Minneapolis, Minnesota, 2019: 4171–4186. doi: 10.18653/v1/N19-1423.
    [3] NI Shiwen and KAO H Y. KPT++: Refined knowledgeable prompt tuning for few-shot text classification[J]. Knowledge-Based Systems, 2023, 274: 110647. doi: 10.1016/j.knosys.2023.110647.
    [4] WANG Yimeng, YANG Zhiyao, and CHE Xiangjiu. A hierarchical mixture-of-experts framework for few labeled node classification[J]. Neural Networks, 2025, 188: 107285. doi: 10.1016/j.neunet.2025.107285.
    [5] CUI Yiming, CHE Wanxiang, LIU Ting, et al. Pre-training with whole word masking for Chinese BERT[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021, 29: 3504–3514. doi: 10.1109/TASLP.2021.3124365.
    [6] SHNARCH E, GERA A, HALFON A, et al. Cluster & tune: Boost cold start performance in text classification[C]. Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics, Dublin, Ireland, 2022: 7639–7653. doi: 10.18653/v1/2022.acl-long.526.
    [7] YU Tao, SONG Rui, PINTO S, et al. GEML: A graph-enhanced pre-trained language model framework for text classification via mutual learning[J]. Applied Intelligence, 2024, 54(23): 12215–12229. doi: 10.1007/s10489-024-05831-1.
    [8] CHEN Junfan, ZHANG Richong, ZHENG Yaowei, et al. DualCL: Principled supervised contrastive learning as mutual information maximization for text classification[C]. Proceedings of the ACM Web Conference 2024, Singapore, Singapore, 2024: 4362–4371. doi: 10.1145/3589334.3645668.
    [9] ZHOU Nai, YAO Nianmin, HU Nannan, et al. CDGAN-BERT: Adversarial constraint and diversity discriminator for semi-supervised text classification[J]. Knowledge-Based Systems, 2024, 284: 111291. doi: 10.1016/j.knosys.2023.111291.
    [10] ZOU Haochen and WANG Zitao. A semi-supervised short text sentiment classification method based on improved bert model from unlabelled data[J]. Journal of Big Data, 2023, 10(1): 35. doi: 10.1186/s40537-023-00710-x.
    [11] LI Shujie, YUAN Guanghu, YANG Min, et al. Improving semi-supervised text classification with dual meta-learning[J]. ACM Transactions on Information Systems, 2024, 42(4): 109. doi: 10.1145/3648612.
    [12] LIAO Wenxiong, LIU Zhengliang, DAI Haixing, et al. Mask-guided BERT for few-shot text classification[J]. Neurocomputing, 2024, 610: 128576. doi: 10.1016/j.neucom.2024.128576.
    [13] HOU Zejiang, SALAZAR J, and POLOVETS G. Meta-learning the difference: Preparing large language models for efficient adaptation[J]. Transactions of the Association for Computational Linguistics, 2022, 10: 1249–1265. doi: 10.1162/tacl_a_00517.
    [14] HE Kai, MAO Rui, HUANG Yucheng, et al. Template-free prompting for few-shot named entity recognition via semantic-enhanced contrastive learning[J]. IEEE transactions on Neural Networks and Learning Systems, 2024, 35(12): 18357–18369. doi: 10.1109/TNNLS.2023.3314807.
    [15] 李俊辉, 侯兴松. 基于伪监督注意力短期记忆与多尺度去伪影网络的图像分块压缩感知[J]. 电子与信息学报, 2024, 46(2): 472–480. doi: 10.11999/JEIT231069.

    LI Junhui and HOU Xingsong. Pseudo supervised attention short-term memory and multi-scale deartifacting network based on image block compressed sensing[J]. Journal of Electronics & Information Technology, 2024, 46(2): 472–480. doi: 10.11999/JEIT231069.
    [16] CHU Yonghe, CAO Heling, DIAO Yufeng, et al. Refined SBERT: Representing sentence BERT in manifold space[J]. Neurocomputing, 2023, 555: 126453. doi: 10.1016/j.neucom.2023.126453.
    [17] ALSUHAIBANI A, ZOGAN H, RAZZAK I, et al. IDoFew: Intermediate training using dual-clustering in language models for few labels text classification[C]. Proceedings of the 17th ACM International Conference on Web Search and Data Mining, Merida, Mexico, 2024: 18–27. doi: 10.1145/3616855.3635849.
    [18] 杨春玲, 梁梓文. 静态与动态域先验增强的两阶段视频压缩感知重构网络[J]. 电子与信息学报, 2024, 46(11): 4247–4258. doi: 10.11999/JEIT240295.

    YANG Chunling and LIANG Ziwen. Static and dynamic-domain prior enhancement two-stage video compressed sensing reconstruction network[J]. Journal of Electronics & Information Technology, 2024, 46(11): 4247–4258. doi: 10.11999/JEIT240295.
  • 加载中
图(5) / 表(7)
计量
  • 文章访问数:  124
  • HTML全文浏览量:  24
  • PDF下载量:  11
  • 被引次数: 0
出版历程
  • 收稿日期:  2026-03-30
  • 修回日期:  2026-08-17
  • 录用日期:  2026-08-17
  • 网络出版日期:  2026-08-26

目录

    /

    返回文章
    返回