WordStat-文本分析软件
欢迎您接见环中1xBET!
WordStat是一款易于使用的文本分析软件 - 不论您是必要文本挖掘工具来提取主题和趋向,还是使用新的定量内容分析工具进行仔细和丈量。必要急剧从大量文档中提取和分析信息的人都能够使用WordStat。此内容分析和文本挖掘软件可用于好多利用法式,例如盛开式响应分析,贸易智能,新闻报路的内容分析等。WordStat与SimStat统计数据分析工具-QDA Miner定性数据分析软件与Stata-StataCorp的综合统计软件为您提供了便捷,能够分析文本并将其内容与结构化信息(数字和分类数据)有关联。
?
使用文本挖掘浏览文档内容
-
使用WordStat分析大量非结构化信息。该软件每分钟可处置2500万个单词,使用聚类,多维缩放,邻近图等职能提取主题并自动鉴别模式。
?

?
使用浏览器模式提取寓意
-
使用资源治理器模式急剧的从大量文本数据中提取寓意,尤其是对那些文本挖掘经验很少的人,只需单击一下,就能够提取文档中常用的单词,短语和凸起的主题。
?

?
从多种起源进口
-
导入Word,Excel,HTML,XML,SPSS,Stata,NVivo,PDF和图像。衔接并直接从社交媒体,电子邮件,网络调查平台和参考治理工具导入。
?

使用主题建模提取主题
-
使用基于单词,短语和有关单词(拼写谬误)的新自动主题提取职能,浏览大型的文本集中的主题。
?

?
索求联系
-
索求单词概想之间的关系,并检索与特定衔接关联的文本段。
?

?
将文本与结构化数据有关联
-
索求非结构化文本与结构化数据(例如日期,数字或分类数据)之间的关系,以鉴别子组之间的功夫趋向或差距,或使用统计和图形工具(对应分析,热图,气泡图等)。
?

?
使用字典分类您的文本数据
-
使用现有词典实现分析自动化,或使用单词,短语,靠近规定等创建您自已的分类模型。
?

?
为词典获得援手
-
使用提取常用短语和技术术语并在文本集中中鉴别拼写谬误,同义词,反义词和有关单词的工具,更快的构建词典。
?

?
使用机械进建分类您的文本数据
-
使用Na?ve Bayes和K-Nearest Neighbours来开发和改进自动文档分类模型。
?

?
一键单击返回源文件
-
通过从职能,图表或图形返回到文正本验证或深刻分析。您能够使用“关键词检索”或“高低文中的关键字”职能来检索句子,段落或整个文档。这在成立分类法或词义歧义时很有效。您还能够将QDA Miner代码附加到检索到的段。
?

?
执行定性编码
-
将WordStat与新的定性编码工具(QDA Miner)结合使用,以便在必要时更正确的索求数据或更深刻的分析文档或提取的文本段。
?

?
将非结构化文本转换为交互式地图(GIS映射)
-
将非结构化文本数据与地理信息有关联,并创建数据点,图和热点图的交互式图表,以及用于将地位名称,邮政编码和IP地址转换为维度和经度的地理编码Web服务。
?

自动提取定名实体
-
自动提取定名的实体,能够使用方便的拖放操作将其增长到分类字典中。
?

导出了局
-
将文本分析了局导出为常见的行业文件体式,例如Excel,SPSS,ASCII,HTML,XML,MS,Word和图形(例如PNG,BMP和JPEG)。
?

?
使用PYTHON剧本转换文本
-
使用Python剧本及其盛开源代码库预处置或转换文本文档,以便在WordStat中进行分析。
?
特点:
使用WordStat,数据分析师能够从大量文档中提取有价值的文本分析了局,例如客户反馈,电子邮件,盛开式回复,采访纪录,功夫汇报,司法文档,博客,网站等。以下是WordStat的内容分析和文本挖掘职能列表:
?
从多个起源导入
WordStat允许您从好多起源直接导入多说话内容:
-
导入文档:Word,PDF,HTML,PowerPoint,RTF,TXT,XPS,ePUB,ODT,WordPerfect。
-
导入数据文件:Excel,CSV,TSV,Access。
-
从统计软件导入:Stata,SPSS
-
从社交媒体导入:Facebook,Twitter,Raddit,YouTube,RSS
-
从电子邮件导入:Outlook,Gmail,MBox
-
从网络调查中导入:Qualtrics,SurveyMonkey,SurveyGizmo,QuestionPro,Voxco,Triple-S
-
从参考治理工具中导入:Endnote,Mendeley,Zotero,RIS
-
导入图形:BMP,WMF,JPG,GIF,PNG。自动提取与这些图像有关的信息,例如地理地位,标题,描述,作者,评论等,并将其转换为变量
-
从XML数据库导入
-
ODBC数据库衔接可用
-
从定性软件导入项目:NVivo,Atlas.ti,Qdpx文件
-
导入和分析多说话文档,蕴含从右到左的说话
-
监督指定文件夹,并自动导入存储在此文件夹中的文档和图像,或监督对原始源文件或联机服务的更改。
?

?
整顿数据
多种职能使您能够通过使分析过程了然的方式组织数据:
-
分组,象征,排序,增长,删除文档或查找沉复项
-
使用文档转换向导手动或自动将变量分配给文档,即:日期,作者某人丁统计数据,例如春秋,性别或地位
-
对变量进行沉新排序,增长,删除,编纂和沉新编码
-
凭据变量值过滤大幼写
?
使用资源治理器模式提取寓意
使用资源治理器模式能够便捷的从大量文本数据中提取寓意,这是为那些文本挖掘经验很少的人设计的。
使用主题建模工具,找出常用的单词,短语并提取文档中的主题。
?

?
使用文本挖掘浏览文档内容
在几秒钟内,索求大量非结构化数据的内容并提取有见解的信息:
-
提取常用的单词,短语,表白方式
-
在单词或短语上使用聚类或2D和3D多维缩放提取主题
-
使用邻近图鉴别与指标关键字同时出现的关键字
-
使用链接分析职能索求单词或概想之间的关系
-
通过利用关键字同时出现前提(在一个案例中,一个句子,一个段落,一个n个单词的窗口,一个用户界说的段)以及聚类步骤(一阶和二阶靠近度,选择)来微调分析性指标
-
使用分层聚类,多维缩放,链接分析和邻近图来索求概想或文档之间的类似性。
?

?
使用主题建模来提取凸起的主题
通过将天然说话处置和统计分析(NNMF或因子分析)结合使用,不只对单词并且对短语也能使用的自动主题提取职能,从大型文本集中概览主题和有关单词(蕴含拼写谬误)。
在层析聚类分析中,一个单词可能呈此刻一个聚类中,主题建?赡芑岬贾碌ゴ视攵喔鲋魈庥泄亓,这一特点更真实的暗示了某些单词的多义性以及该单词的多个高低文单词用法。
?

索求联系
使用网络图索求单词或概想之间的联系。使用三种布局类型检测共现的基础模式和结构:多维缩放,基于力的图形和圆形布局。
图形是交互式的,可用于索求关系并检索与衔接关联的文本段。
?

使用文本与结构化数据有关
索求非结构化文本与结构化数据之间的关系:
-
鉴别功夫趋向,子组之间的差距,或使用统计和图形工具(误差表,对应分析,热图,气泡图等)评估与等级或其他类型或数字数据的关系。
-
使用分歧的关联怀抱的评估单词出现与名义或有序变量之间的关系:卡方,似然比,Tau-a,Tau-b,Tau-c,对称Somer's D,非对称Somers'Dxy和Dyx,Gamma,Person's R,Spearman's
?

使用字典对文本数据进行分类
使用现有字典实现分子自定化,或者创建您自已的单词和短语分类模型
在字典中,能够实现布尔值(AND,OR,NOT)和靠近度规定(NEAR,AFTER,BEFORE),并使用正则表白式公式从文本数据中提守信息。
字典调节的词语建饰和词干可用于多种说话,并且自动单词代替选项使您能够用指标关键字代替多个单词。用户界说的停用词列表可用多种说话提供。以预防出现非必要的常用词(例如他,她,它等)在分析中使用。
?

获得词典构建援手
通过提取常用短语和技术术语以及在文本集中中鉴别拼写谬误和有关单词(同义词,反义词,全名,同义词,上位词,下位词)的工具,获得推算机协助,以成立分类尺度。
?

使用机械进建自动对文本数据进行分类
使用Na?ve Bayes和K-Nearest Neighbours开发和优化自动文档分类模型。用户能够选择多种验证步骤:leave-but-one,n-fold cross-validation,split sample。尝试?榭捎糜诒攘υげ饽P秃途芊掷嗄P。
分类模型能够保留到磁盘中,并稍后在QDA Miner中的独立文档分类实用法式,号令行法式或编程库中利用。
?

一键返回源文档
通过使用关键字检索或高低文中的关键字来检索句子,段落或整个文档,从职能,图表或图形中返回文本,从而验证或深刻分析。这在成立分类法或词义歧义时很有效。
检索到的文本段能够按关键字或自变量排序。您能够将QDA Miner代码附加到检索到的段上,或以表格体式(Excel,CSV等)或文本汇报(MS Word,RTF等)将其导出到磁盘。
?

执行定性编码
将WordStat与新的定性编码工具(QDA Miner)结合使用,以便在必要时更正确的浏览数据或更深刻的分析指定文档或提取的文本段。
?

将非结构化文本转换为交互式地图(GIS映射)
将非结构化文本数据与地理信息有关联,并创建数据点,主题地图和热图的交互式图表,以及用于将地位名称,邮政编码和IP地址转换为纬度和经度的地理编码Web服务。
?

?
自动提取名称和拼写谬误
自动提取定名实体(名称,技术术语,产品和公司名称),能够使用方便的拖放操作将其增长到分类字典中。
拼写谬误和未知单词会自动提取出来,并与用户词典中的现有条款匹配,并且能够迅速增长到词典中。
?

?
导出了局
将文本分析了局导出为常见的行业文件体式(例如Excel,SPSS,ASCII,HTML,XML,MS Word),以及统计分析工具(例如SPSS和STATA)以及图形(例如PNG,BMP和JPEG)。
?

?
使用Python剧本转换文本
使用Python剧本及其盛开代码库来预处置或转换文本文档,以便在WordStat中进行分析。
?
WordStat 2023的新职能:
?
WordStat 2023的颁布,这代表着在将词义消歧利用于主题模型方面向前迈出了沉要一步。我们特有的主题丰硕职能经历了沉大改进,引入了几个新的主题建模职能,以援手用户从他们的数据中获得更深刻的见解。此表,还执行了多项速杜着化,使软件响应速度更快、用户更敦睦。
?
1. 改进主题丰硕
WordStat此刻向提取的主题增长了更多有关短语,同时还为其他短语提供了改进的建议。此表,它此刻在鉴别假阳性表白或异常方面拥有更高的正确性,能够将其归并到主题模型中,以援手削减与提取的主题无关的高低文有关的单词的歧义。
?
2. 主题建模词云
主题模型表右侧的比力面板此刻有一个新增长的词云,直观地描述了所选主题中排名靠前的词的相对沉要性。此词云能够自界说、复造到剪贴板或以BMP、PNG或JPEG等尺度图形体式保留到磁盘。
?
3. 新增集成文本检索职能
能够启动主题网格右侧的一个新的方便的示例文本面板,以自动显示与所选主题匹配的句子或段落。这些文本片段按有关性降序分列,主题词以粗体显示,便于理解每个主题的性质并鉴别可用于注明的关键示例。这个强的工具使用户能够更深刻地相识他们的数据,并推进更有效地互换他们的发现。 ?
?
4. 提高顶部富集速度
由于进行了大量的优化工作,主题丰硕过程得到了显着加快,导致机能提高比以前的版本快10到20倍。 ?
?
5. 瞬时短语提取
利用多核处置的强职能,短语提取此刻与重要文本处置无缝集成,使用户险些能够即时接见了局。例如,在蕴含超过50,000条客户评论的数据集上,提取常用的5000个短语此刻只需0.4秒即可实现,而之前的版本必要14秒。
?
技术信息?
操作系统:Microsoft Windows XP , 2000 , Vista , Windows 7,8和10?
内存:从256MB(XP)到1GB(Vista , Windows 7, 8和10)
磁盘空间:40MB?
- 2026-07-24
- 2026-07-23
- 2026-07-21
- 2026-07-15
- 2026-07-15
- 2026-07-15
- 2026-07-24
- 2026-07-24
- 2026-07-24
- 2026-07-23
- 2026-07-23
- 2026-07-23






