Skip to content

mewlconverter v3.4.3 转换「微软拼音自学习词库」后无法导入(提示文件损坏),疑为格式处理回归 #421

Description

@In233

环境

项目 版本 / 说明
imewlconverter v3.4.3(对照版本 v3.4.0,同一台机器、同一份源文件)
操作系统 Windows 11 24H2,内部版本 26100.9445,64 位

问题描述

v3.4.3 转换生成的「微软拼音(Win10 自学习词库)」文件,导入微软拼音时报:

失败:文件格式错误或文件已损坏

v3.4.0 用同样的源文件、同样的目标格式,可以正常导入。

复现步骤

  1. 打开 imewlconverter,载入源词库文件;
  2. 目标格式选择「微软拼音(Win10 自学习词库)」;
  3. 源文件解析方式分别使用 内置格式转换自定义词库编码(默认配置),各转换一次;
  4. 在微软拼音「词库和自学习 → 自学习词库 → 导入」中导入生成的文件 → 失败。

现象对比

版本 源文件解析方式 转换后词条形态 导入结果
v3.4.3 自定义(默认) 测试,ce shi ,1 ❌ 文件格式错误或已损坏
v3.4.0 内置格式转换 测试,ce,shi 测试 1 ✅ 正常导入
v3.4.0 自定义(默认) 测试,ce,shi 测试 1 ✅ 正常导入

分析

  1. 两个版本产出的词条形态不同

    • v3.4.0:测试,ce,shi 测试 1 —— 呈现为「编码,编码,编码␣␣词条␣词频」的多段结构;
    • v3.4.3:测试,ce shi ,1 —— 形态上像是源文件行被原样透传(仍是「词语,拼音,词频」的排列,拼音音节之间保留空格,逗号前还多一个空格),没有转换成目标词库所需的记录结构。生成的文件结构因此不合法,导入端判定为"格式错误或已损坏"。
  2. 自定义配置疑似不生效:在 v3.4.3 的「自定义词库编码」中手动调整过词条排序、分隔符、词频等选项,输出形态没有任何变化,生成的文件依旧无法导入。

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions