[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"cms-guide-article:ming-ming-shi-ti-shi-bie-gong-ju-shi-yong-jiao-cheng-cong-wen-ben-zhong-ti-qu-ren-ming-di-ming-ji-gou-he-shi-jian-xian-suo":3},{"article":4},{"id":5,"userId":6,"title":7,"content":8,"type":9,"lang":10,"index":11,"category":12,"tags":13,"coverImages":15,"slug":17,"summary":18,"associatedTaskType":19,"nextSteps":20,"isPublic":41,"createdAt":42,"updatedAt":43},"6a2ab66d91a276b608e2961e","6804358a59ddd2c7c898172e","命名实体识别工具使用教程：从文本中提取人名、地名、机构和时间线索","\u003Cp>命名实体识别做的是对象抽取。系统先读取上传的 TXT 或 CSV 文本，把正文拆成句子，再在句子中识别人名、地名、机构名、时间等实体。每条实体都会保留原句、类型和位置，因此你看到的不只是一个词表，而是一张可以回到上下文的明细表。\u003C\u002Fp>\u003Cp>报告采用两种识别口径。规则识别偏稳定，适合快速获得常见中文专名线索；语义识别会结合句意判断人物、地理位置、组织机构和时间，边界或数量可能与规则识别不同。两种结果并排显示时，差异不是错误提示，而是提醒你对重要句子做人工复核。\u003C\u002Fp>\u003Cp>处理时可以上传自定义字典，让领域词或机构简称更容易被完整切分；也可以上传停用词表，过滤不希望进入结果的噪声词。分词模式和词性过滤会影响规则识别结果，尤其是中文文本中专名被切开的情况。长文档为了保证页面可读性，报告页可能只显示前段预览，完整逐条明细仍在下载 CSV 中。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>适用文档\u003C\u002Fh2>\u003Cp>文本长度方面，命名实体识别更适合信息密度较高的材料。单篇几百字以上通常更容易出现稳定线索；如果只有一句口号或几个编号，报告可能几乎没有结果。新闻报道、政策文件、访谈记录、舆情评论和研究语料都适合先做实体整理。长文档可以处理，但页面明细会压缩展示，完整结果需要下载 CSV 查看。\u003C\u002Fp>\u003Cp>文本质量方面，输入应当是可读正文。报告页面明确提示，文件建议使用 UTF-8 编码的 .txt 或 .csv。如果文件为空、编码异常、几乎只有编号，或经停用词过滤后没有可读内容，就可能没有可展示结果。网页抓取文本里如果混入大量导航、页脚、乱码或重复模板，建议先做文本清洗；繁简混用、全半角混乱时，可以先做中文文本规范化。\u003C\u002Fp>\u003Cp>语言和行业方面，这个工具主要面向包含中文专名的文本。政策文本可以用来整理部门、地区和时间线索；新闻报道可以用来梳理人物、机构和地点；访谈材料可以用来盘点受访者反复提到的对象。领域术语较多时，建议上传自定义字典。例如医院简称、社区名称、项目代号如果经常被切散，自定义字典能帮助规则识别保留更完整的词形。\u003C\u002Fp>\u003Cp>输入格式方面，工具页面支持 TXT 和 CSV，单文件大小按页面限制执行。TXT 按正文处理；CSV 会读取文本列并进入分析流程。自定义字典和自定义停用词使用 TXT 文件，每行一个词。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>使用步骤\u003C\u002Fh2>\u003Cp>第一步：上传文件。进入命名实体识别页面后，上传 TXT 或 CSV 文件。如果是 CSV，通常应选择包含正文的列，避免把编号列、空列或无关字段混入正文。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fb9123a17877cd5ce33a511e8f0b45f6f.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第二步：配置参数。常规材料可以先保持默认；如果材料里有机构简称、项目名或地名缩写，上传自定义字典；如果有模板词、口头禅或明显无意义词，上传自定义停用词。分词模式、词性过滤和智能词汇识别的细节在下一节说明。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fca59f68e99aded607defb57854b6af30.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第三步：查看顶部解读。报告完成后，先看顶部结果卡片。这里会概括工具在做什么，并给出实体总量、实体类型数、含实体句占比、规则识别数量和语义识别数量等信息。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fd1f385516fdb9ea3936d3ce9842e9c3b.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第四步：查看高频实体和对照明细。高频实体卡片分别展示规则识别和语义识别中更集中的实体。实体对照明细按句展示，表格列包括序号、句子、规则识别、语义识别。你可以搜索句子或实体，也可以翻页抽查边界。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F159ff0a721ef2c9d7d500fe0d1afcbf1.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F080f25cd26ad8ad16b4d187a2fc31820.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第五步：下载结果。下载 CSV 后可以得到实体明细和统计表。实体明细包含原句、词、类型、开始位置、结束位置；统计表包含实体类型数量、总句子数、包含实体的句子数和平均每句实体数等信息。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>参数解析与对比示例\u003C\u002Fh2>\u003Cp>可配置参数如下。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义字典\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">上传 TXT 词典，每行一个词，用于辅助领域词、机构简称、地名缩写等内容切分\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭，未上传\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义停用词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">上传 TXT 停用词表，每行一个词，用于过滤模板词、口头禅或无意义词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭，未上传\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">智能词汇识别\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">尝试从语料中发现新词，并作为补充分词词典参与处理；耗时较长，新词不保证单独出现在最终结果里\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词模式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">中文分词方式，可选精确模式、全模式、搜索引擎模式；一般先用精确模式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确模式\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性过滤\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">选中的词性类型会在分词阶段被排除，不参与后续处理；仅适合中文文本\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">完成后发送邮件通知\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">任务完成后发送邮件提醒，不影响识别结果\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>三组典型配置供参考。\u003C\u002Fh2>\u003Col>\u003Cli>快速新闻梳理。保持默认配置，直接上传新闻报道 TXT 或 CSV。适合先看人物、机构、地点和时间是否集中，再用搜索框核对重点实体。\u003C\u002Fli>\u003Cli>领域材料识别。上传自定义字典，保持精确模式，不开启过多词性过滤。适合政策、医疗、金融、学校或社区材料中存在大量简称和专有名称的情况。\u003C\u002Fli>\u003Cli>访谈或问卷整理。上传停用词表，过滤「这个」「然后」「感觉」等不需要进入结果的词。词性过滤要谨慎使用，不建议把人名、地名、机构团体名等类别排除，否则会影响实体召回。\u003C\u002Fli>\u003C\u002Fol>\u003Cp>分词模式会改变规则识别的边界。全模式和搜索引擎模式可能产生更多候选词，也可能带来重复或噪声；如果目标是稳定整理对象清单，建议先用精确模式跑一次，再根据结果决定是否调整。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>案例分析\u003C\u002Fh2>\u003Cp>案例一：新闻事件报道梳理。\u003C\u002Fp>\u003Cp>背景：研究人员收集了 20 篇同一事件的新闻报道，想先整理涉事人物、机构、地点和时间，再做事件线索分析。\u003C\u002Fp>\u003Cp>配置：保持精确模式，上传包含常见机构简称的自定义字典，不使用词性过滤。\u003C\u002Fp>\u003Cp>结果：报告顶部先显示实体总量、实体类型数和含实体句占比。高频实体卡片帮助研究人员锁定反复出现的人物和机构。随后在对照明细里搜索 6 个重点机构名，逐句核对规则识别和语义识别的差异。下载的实体明细 CSV 被用于整理人物、机构和地点清单。\u003C\u002Fp>\u003Cp>结论：命名实体识别把对象整理提前完成，后续再做事件时间线或词语共现时，不需要从原文里反复人工查找同一批名称。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>案例二：访谈材料对象盘点。\u003C\u002Fp>\u003Cp>背景：调研团队整理 60 段访谈文本，受访者反复提到社区、学校、医院和若干具体地点。团队希望先知道哪些对象最常被提到，再进入主题分析。\u003C\u002Fp>\u003Cp>配置：上传访谈文本 CSV，选择正文列；上传停用词表过滤常见口语词；保持精确模式，不排除人名、地名和机构团体名。\u003C\u002Fp>\u003Cp>结果：报告中的含实体句占比用于判断材料里对象线索是否足够。团队在实体对照明细中搜索学校和医院名称，查看这些实体出现在哪些句子中。长文档页面只保留前段预览时，团队下载完整 CSV 做后续归类。\u003C\u002Fp>\u003Cp>结论：先做实体识别有助于把「谁」「哪里」「哪个机构」从主题里拆出来。主题分析负责看议题，实体识别负责整理对象，两者分工更清楚。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>类似功能对比\u003C\u002Fh2>\u003Cp>命名实体识别、高频词提取、关键词抽取都能从文本中提取词项，但关注点不同。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">对比维度\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">命名实体识别\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">高频词提取\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关键词抽取\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">做什么\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">提取人名、地名、机构名、时间等对象线索\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">统计出现次数较高的词或词组\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">提取更能代表主题的词\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关注点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">对象、类型、原句位置\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">频次和固定搭配\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">代表性和主题相关性\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">报告重点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">顶部解读、高频实体、实体对照明细\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词频结果和词组结果\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关键词列表和权重\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">适合问题\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">文本里有哪些人物、地点、机构和时间\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">哪些词被反复提到\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">哪些词概括主题\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">后续用途\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">事件梳理、对象清单、共现分析\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">语料概览、提法盘点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">主题标签、摘要辅助\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>如果你关心的是「材料里有哪些对象」，先用命名实体识别。如果你关心的是「什么词出现得最多」，用高频词提取。如果你关心的是「哪些词最能代表主题」，用关键词抽取。三者可以连续使用，但不要把高频词直接当成实体，也不要把实体数量当成主题重要性。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>","admin_cms","zh-cn",0,"guide",[14],"文本分析基础教程",[16],"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fcover\u002Fdd9c77ccbe5a3e27abd25f53df74c807.png","ming-ming-shi-ti-shi-bie-gong-ju-shi-yong-jiao-cheng-cong-wen-ben-zhong-ti-qu-ren-ming-di-ming-ji-gou-he-shi-jian-xian-suo","命名实体识别适合在正式分析前整理对象清单。它会从 TXT 或 CSV 文本中提取人名、地名、机构名、时间等专名线索，并保留实体所在原句、实体类型、开始位置和结束位置。报告页会同时展示规则识别和语义识别两种口径，上方先给出整体解读，下方用高频实体和句子级对照表帮助你回到原文复核。这个功能不替你判断人物关系或事件因果，它的价值在于把散在文本里的对象先整理出来。","entity-recognition",[21,26,31,36],{"taskType":22,"name":23,"shortDesp":24,"_id":25},"word-co-occurrence","词语共现分析","找出文本里经常成对出现的词，并用多项统计指标判断这种搭配是否真的稳定。","6a2abb1791a276b608e2ced8",{"taskType":27,"name":28,"shortDesp":29,"_id":30},"deep-senti","DeepSentiV2深度学习情感分析","使用深度学习模型判断情感倾向，支持电商、学术、金融等 7 种行业语境，输出关键词和置信度。","6a2abb1791a276b608e2ced9",{"taskType":32,"name":33,"shortDesp":34,"_id":35},"lda","LDA 主题模型","从文本中发现若干主题，展示主题词、文档分布及主题之间的关系。","6a2abb1791a276b608e2ceda",{"taskType":37,"name":38,"shortDesp":39,"_id":40},"event-timeline","事件时间线抽取","从长文中抽取时间、事件、主体、地点并归一化日期，输出可排序的时间线。","6a2abb1791a276b608e2cedb",true,"2026-06-11T13:21:49.346Z","2026-06-11T13:41:43.920Z"]