任攀指出古文字学是“冷门绝学”,面临从业人员少、学术门槛高等困境,亟须推动传统科研范式向科学智能转型。他分析了古文字材料难以被大模型理解的原因,包括训练数据样本少、分布不均衡、大量未释读字无标准答案,以及多模态模型容易混淆形近古文字等问题。
金连文在第二届CCF人文智能大会上分享了团队古籍OCR研究成果:研发的通古OCR大模型覆盖3.4万余字符类别、600余万样本,支持七类书体,通过版面感知智能分块、小模型识别加大模型后纠错及异体字保护机制,识别准确率超过现有方法,并已上线古籍OCR实时演示系统。