# 计算机语言学习 **Repository Path**: me860/learning-computer-languages ## Basic Information - **Project Name**: 计算机语言学习 - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-09-29 - **Last Updated**: 2026-09-30 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # learning-computer-languages 编程语言学习仓库:按语言分目录存放各学习项目。 ## 项目索引 | 语言 | 项目 | 说明 | |---|---|---| | C# | [csharp/FmmTokenizer](csharp/FmmTokenizer) | 中文分词器:正向最大匹配(FMM)、逆向最大匹配(BMM)、双向消歧(BMMS),46 个单元测试;内置黄金切分评估器,支持 100 段真实人民日报新闻语料处理 | > 学习过程中出现的技术术语统一记录在 [GLOSSARY.md](GLOSSARY.md),随项目演进持续补充。 ## 如何运行 ```bash cd csharp/FmmTokenizer # 内置 12 句黄金切分评估(FMM/BMM/双向三方对比) dotnet run # 运行全部单元测试 dotnet test # 采集测试覆盖率(行/分支覆盖率 100%) dotnet test --collect:"XPlat Code Coverage" ``` ## 真实新闻语料处理(100 段人民日报新闻) 语料与词典体积较大不入库,先下载到 `data/` 目录: ```bash cd csharp/FmmTokenizer mkdir -p data # 结巴分词词典(约 35 万词) curl -L -o data/dictionary.txt https://raw.githubusercontent.com/fxsjy/jieba/master/jieba/dict.txt # SIGHAN 2005 分词评测 PKU 测试集(人民日报新闻,原文 + 黄金切分逐行对齐) curl -L -o data/pku_test.utf8 https://cdn.jsdelivr.net/gh/yuikns/icwb2-data@master/testing/pku_test.utf8 curl -L -o data/pku_gold.utf8 https://cdn.jsdelivr.net/gh/yuikns/icwb2-data@master/gold/pku_test_gold.utf8 # 哈工大停用词表(TF-IDF 关键词提取用,缺失时自动降级为不启用) curl -L -o data/stopwords.txt https://cdn.jsdelivr.net/gh/goto456/stopwords@master/hit_stopwords.txt # 处理语料:分词样例 + 处理统计 + 对照黄金切分的评估成绩 + 词频 Top 20 dotnet run -- corpus # TF-IDF 关键词提取:纯 TF 与 TF-IDF(停用词版)Top 10 对照表 dotnet run -- tfidf ``` ## 目录约定 - 每种语言一个顶层目录(如 `csharp/`、`python/`、`go/`) - 每个学习项目独立子目录,自带项目文件与单元测试 - 通用忽略规则见根目录 `.gitignore`(`bin/`、`obj/`、`TestResults/` 等)