使用GAUSS 22相识您的数据
欢迎您接见环中1xBET!
数据整顿、算帐和索求子啊实证钻研中都表演着分歧的角色。数据治理可能很耗时、易犯错、并且可能会产生或粉碎了局。
?
GAUSS 22旨在去除处置数据的麻烦,在这篇文章中,我们将介绍怎么子啊建;蚬兰浦坝行У爻锉负退髑笳媸档氖,我们将看看:
-
加载数据中
-
算帐数据以去除谬误输入、缺失值等。
-
索求数据
?
在整个文章中,我们将使用Kaggle上提供的Kick Starter 2018数据。
?
一、加载数据中
让我们起头在“数据导入”窗口中打开1xBET数据。这能够通过两种方式实现:
-
从GAUSS主菜单当选择文件 > 导入数据。
-
在“项目文件加妆窗口中双击文件名。
?
数据预览正确地向我们展示了数据将怎么加载,并且对于在我们呢加载数据之前鉴别数据问题很有效。
?
我们能够从数据预览中看出:
1xBET数据有不应加载的附加标头。
有以表的符号或不成接受的字符。
短缺观察。
数据在加载为我们想要的类型。
?
礼物,1xBETKickstarter数据的数据预览中,我们能够看到GAUSS在检测预览中,我们能够看到GAUSS在检测变量Category是一个字符号。鄙人一节中,我们将相识怎么将其改为分类变量。
?
在数据导入窗口中治理数据
?
让我们看看怎么使用mport Windows实现初步的数据算帐。具体来说,我们将:
1、更改数据框名称更方便地引用。对于Kickstarter数据,默认符号名称是ks_projects_201801.让我们将其更改为更单一的名称ks_projects,使用符号名称的名称。
2、Cetagory将变量类型从String更改为Category。使用变量列表中的类型下拉菜单更扭转量类型。如有必要,能够使用Modify Column Mapping对话框更改分类映射。
3、从导入列表中删除不必要的变量以预防工作空间混乱。元素数据集通常蕴含我们不必要的有余变量。1xBETKickstarter 数据蕴含本地钱币和真实美元的筹款承诺
我们能够取缔选择变量pledged,以及currency from Variables。
4、过滤数据以构建适当的模型
数据集通;乖毯颐遣幌朐毯谀P椭械墓喙鄄炝司。“过滤器”选项卡式删除观察值的一种急剧渐变的步骤。让我们过滤1xBET数据以删除全数颁布日期早于"2015"的观察了局。
?

在执行初步数据算帐步骤后,我们单击导入以加载1xBET数据。
?
可沉用的自动天生代码
数据导入工具的职能之一是它为我们使用数据导入工具执行的全数步骤自动天生代码。
?

自动天生的代码在导入后打印到号令窗口并列在号令汗青纪录中。它能够复造和粘贴以备后用。
?
二、算帐1xBET数据
此刻我们已经加载了1xBET数据,让我们更好地相识1xBET数据。将对常见数据问题进行一些急剧查抄,例如:
沉复观察
缺失值
数据谬误
?
查看数据
让我们在符号编纂器中打开1xBETks_projects数据以确认它正确加载。
?

查抄沉复数据
加载数据后,采取的是查抄沉复数据,沉复数据会扭曲了局,应在建模前往除。
GAUSS蕴含在GAUSS 22中引入的三个函数,用于处置沉复数据:
?
作为初步查抄,让我们看看数据是否有沉复的ID观察了局。
?

isunique法式返回1.0000000通知我们1xBET数据是单一的。
?
三、查抄谬误输入和拼写谬误
分类和字符串数据存在拼写、缩写等谬误的机遇。有时很难在数据中找到这些谬误。
该frequency过程是查抄分类变量质量的好步骤。让我们来看下country变量的频率汇报。
?


在这个列表中我们看到一个奇怪的类别,N,0". 但是,鉴于此类此外频率。这不在可能是谬误输入,可能不想删除此标签,不外,从标签中删除非尺度字符是合理的:
?
此刻,查抄1xBET频率,我们会看到更新后的country标签:
?

天生新变量
GAUSS数据框能够很单一地使用现有变量创建新变量,即框能够很单一地使用现有变量创建新变量。
如果我们对活动启动和截止日期之间的功夫量对承诺的影活动启动和截止日期之间的功夫量对承诺的影功夫量的变量。
GAUSS日期处置和变量名引用使创建变量变得单一。
?

必要把稳的一点是,1xBET新变量total_days是尺度 GAUSS 矩阵,而不是数据框。我们能够使用该asDF过程转换total_days为 GAUSS 数据帧并增长变量名称。
?
让我们这样做并将新变量衔接到1xBET原始数据:

?
当我们ks_projects在符号编纂器中打开时,我们此刻能够看到1xBET新变量Total Time及其类型在变量列表中列出。

?
相识1xBET数据
此刻我们已经执行了一些初步的数据算帐步骤,是时辰通过一些单一的数据索求来更好地相识1xBET数据了。
?
汇总统计
急剧汇总统计数据使我们可能深刻相识1xBET数据,并有助于发现异常值和其他数据异常。
?
该dstatmt过程允许我们在一行中推算描述性统计数据。它推算以下统计数据:
-
Mean
-
Standard deviation
-
Variance
-
Minimum
-
Maximum
-
Valid cases
-
Missing cases
?
办理手续有几点必要把稳dstatmt:
?
推算字符串变量的有效和缺失观测值。
不推算分类变量的Mean、Std Dev和Variance 。但是,较幼和较大观察值是凭据基础键值推算的。
让我们看一下我们ks_projects数据的汇总统计信息:
?

?
从这些描述性统计数据中脱颖而出的一件事是有好多缺失的观察了局usd_pledged。
?
一种解决规划是使用usd_pledged_real和删除usd_pledged_variableusingdelcols过程
?

?
分组统计
此刻,让我们看看变量的均匀值若何使用该过程在变量中usd_pledged_real变动。main_categoryaggregate

这很有效,我们能够看到分歧项目类此外均匀认捐金额存在显著差距。但是,若是我们使用以下步骤对了局进行排序,可能会更单一看到这些差距sortc:
?

此刻我们能够明显地看到, Craft项主张均匀承诺金额低,而Design项主张均匀承诺金额。
?
用可视化索求1xBET数据
数据可视化是初步数据索求工具之一。他们能够援手我们:
?
-
鉴别数据中的异常值和异常值。
-
找出变量之间的关系。
-
鉴别功夫序列动态。
-
这些都提供了有助于领导建模的见解。
?
与出版物图形分歧,用于索求的初步数据可视化不必要太多自界说体式和注解。相反,我们能够急剧清澈地绘造图表。
?
在 GAUSS 22 中,画图通过智能图形属性得到加强,使数据可视化变得越发单一和有效,蕴含:
-
使用方便的公式字符串指定要按名称绘造的变量的能力。
-
自动使用变量名称和类别标签。
-
by使用 new关键字进行数据拆分。
例如,让我们看看usd_pledged_real与Total Time我们使用散点图创建的变量的关系:
?

1xBET图表提供了一些急剧的数据洞察:
?
-
大无数告白系列的长度在 0-60 天之间。
-
似乎有约莫 30、45 和 60 天长度的活动集群。
-
竞选时长和承诺的美元之间似乎没有太大的有关性。
-
大无数活动的收入低于 3e+06,并且有好多活动没有收到承诺。
?
凭据观察,它可能有效:
1、过滤掉没有得到保障的观察(我们不会在这里会商截断数据的主题,我并不是说这通常是一个很好的建模步骤)
?

usd_pledged_real使用以下quantile过程查看百分位数:

?
这很有援手,它通知我们 50% 的usd_pledged_real观察值低于约 1,000 美元,80% 低于约 10,000 美元,90% 低于约 19,000 美元。
?
鉴于这些观察了局,让我们看一下介于 10% 和 50% 之间的承诺的直方图:

?
?
-
2026-04-13
GMS 10.9 中文版正式颁布 — 新增 PFAS 运移仿照与地下水能量(GWE)?
GMS 10.9 中文版现已颁布。本次更新新增 MODFLOW-USG Transport 对 PFAS 运移仿照的支持、MODFLOW 6 地下水能量(GWE)模型、UGrid 多项改进以及 MODFLOW 6 界面优化等职能,为地下水数值仿照与地热储能分析提供更多工具支持。
查看详情 >
-
2026-03-26
Origin 2026 SR1 服务更新包颁布
Origin 2026 服务更新包1现已颁布,合用于更新现有Origin或OriginPro 2026 SR0装置或全新装置。本次更新建改了智能填充、Excel公式、分组画图批量操作及归并图形兼容性等多处问题,并解决了部门崩溃谬误。装置后版本号将升级到10.3.0.197,用户可通过“援手:关于Origin”确认更新实现。
查看详情 >
-
2026-03-10
GTAP数据库 V12已正式颁布 - 附视频介绍
GTAP(Global Trade Analysis Project)是一个设立在美国普渡大学农业经济系的经济钻研组织。该项目成立于1992年,旨在为业务政策分析和可推算通常平衡(CGE)建模提供数据支持。全新版GTAP V12已于2026年2月正式颁布,欢迎联系北京1xBET科技订购正版GTAP数据库。
查看详情 >
