文本分析软件Leximancer支持的多说话职能
欢迎您接见环中1xBET!
Leximancer能够处置除了英语以表的其他说话的文本。当前软件支持的说话列在侧边栏中。
?
默认说话支持
英语, 丹麦语, 德语, 芬兰语, 希腊语, 西班牙语, 法语, 克罗地亚语, 印度尼西亚语, 意大利语, 马来语, 荷兰语, 波兰语, 葡萄牙语, 俄语, 塞尔维亚语, 瑞典语, 土耳其语
?
支持新说话
若是在所需说话中有明确的单词和句子分隔象征,Leximancer可能支持新说话。必须假造所需说话的常用术语的“停用词列表”(例如“和”、“the”、“but”等),以便将这些词排除在概想候选人的处置之表。
?
能够在统一Leximancer分析/地图中建模多种说话吗?
能够,但了局可能不是您所想要的。Leximancer不执行自动翻译,因而分歧说话中意思一样的两个概想在通例文本数据中不会自动归并。了局地图将拥有各自说话的大部门独立概想群集。您能够手动在说话之间归并主题概想,若是归并足够多,说话群集将归并。
?

?
要在统一项目中映射来自多种说话的数据,您必须执行两项工作:
- 在选择数据集时为每个数据集指定说话;
- 对于每衷熹他说话,必须在停用词编纂器中加载停用词列表(使用顶部的“加载说话”按钮)。
?
为什么非英语说话文档的停用词依然存在于项目中?
要自动增长文档说话的停用词列表,应在将源文本文档增长到项目之前选择下拉说话列表中的说话。若是在运行项主张任一步骤之前未选择说话,则Leximancer将设置默认的停用词列表,通常为英语。停用词列表不会再进行自动更改。
?
要在项目运行任一步骤后增长新说话或更新特定停用词条款,应使用停用词列表编纂对话框D芄煌ü 按钮从文本处置设置对话框中使用此对话框D芄淮幽抢镌龀ば碌耐S么仕祷。编纂Leximancer项目停用词列表。
?
跨说话概想
有一种特殊的数据大局会自动发现跨说话概想,这可能很有趣。所需的数据称为逐字翻译 - 每个句子的一个说话中有该句子的翻译,紧接在其后。要处置此类数据,您必要创建一个特殊的多说话停用词列表,其中所有停用词在列表中共享一样的文字说话代码。
?
是否必要特殊版正本支吃熹他说话?
Leximancer内置了对多种说话的支持。
?
若何为文档选择说话?
将每个数据文件拖入文本选择面板时,必须为其选择说话代码。若是将鼠标悬停在列表中的代码上,您能够看到每种说话的全名。您可能必要更改字符集(字符编码)以及默认的utf-8。此字符编码是您数据的属性。
?
说话差距的特殊当苦衷项是什么?
使用非英语说话时有几个当苦衷项。以下是总结:
? ? 1、停用词删除
????2、大写单词
????3、词干提取
?
若何编纂支持的说话的停用词列表?
您能够在项目节造的预处置阶段设置中编纂停用词列表。您可能还必要增长到我们默认列表中的其他停用词。保留编纂后的停用词列表后,您能够再次打开它,并使用下载按钮将您建悔改的停用词列表保留到本地磁盘。您能够使用停用词编纂器中的上传按钮将其上传到其他项目中。
?
支持的说话有哪些?
当前支持的说话列表可在上方找到。目前无法与Leximancer一路使用没有 readily identifiable word spacing的说话(例如,中文)。
?
支持的字符集是哪些?
- ISO-8859-1, ISO Latin Alphabet No. 1,
- US-ASCII, American Standard Code for Information Exchange,
- UTF-8, Eight-bit UCS Transformation Format,
- WINDOWS-1252, Windows Western Alphabet,
- MacRoman, Apple Standard Roman,
- UTF-16, Sixteen-bit UCS Transformation Format, byte order identified by an optional byte-order mark,
- UTF-16BE, Sixteen-bit UCS Transformation Format, big-endian byte order,
- UTF-16LE, Sixteen-bit UCS Transformation Format, little-endian byte order,
- WINDOWS-1250, Windows Eastern European,
- WINDOWS-1251, Windows Cryillic,
- WINDOWS-1253, Windows Greek,
- WINDOWS-1254, Windows Turkish,
- WINDOWS-1257, Windows Baltic,
- ISO-8859-2, ISO Latin Alphabet No. 2,
- ISO-8859-4, ISO Latin Alphabet No. 4,
- ISO-8859-5, Latin/Cyrillic Alphabet,
- ISO-8859-7, Latin/Greek Alphabet,
- ISO-8859-9, ISO Latin Alphabet No. 5,
- ISO-8859-13, ISO Latin Alphabet No. 7,
- ISO-8859-15, ISO Latin Alphabet No. 9,
- KOI-R, KOI8-R Russian
- KOI8-R, KOI8-R Russian
?
?
?
- ?
-
2026-04-13
GMS 10.9 中文版正式颁布 — 新增 PFAS 运移仿照与地下水能量(GWE)?
GMS 10.9 中文版现已颁布。本次更新新增 MODFLOW-USG Transport 对 PFAS 运移仿照的支持、MODFLOW 6 地下水能量(GWE)模型、UGrid 多项改进以及 MODFLOW 6 界面优化等职能,为地下水数值仿照与地热储能分析提供更多工具支持。
查看详情 >
-
2026-03-26
Origin 2026 SR1 服务更新包颁布
Origin 2026 服务更新包1现已颁布,合用于更新现有Origin或OriginPro 2026 SR0装置或全新装置。本次更新建改了智能填充、Excel公式、分组画图批量操作及归并图形兼容性等多处问题,并解决了部门崩溃谬误。装置后版本号将升级到10.3.0.197,用户可通过“援手:关于Origin”确认更新实现。
查看详情 >
-
2026-03-10
GTAP数据库 V12已正式颁布 - 附视频介绍
GTAP(Global Trade Analysis Project)是一个设立在美国普渡大学农业经济系的经济钻研组织。该项目成立于1992年,旨在为业务政策分析和可推算通常平衡(CGE)建模提供数据支持。全新版GTAP V12已于2026年2月正式颁布,欢迎联系北京1xBET科技订购正版GTAP数据库。
查看详情 >
