Xcalibre 软件:项目反映理论(IRT)入门、模型与示例
欢迎您接见环中1xBET!
什么是项目反映理论(IRT)?
IRT 是生理丈量学领域中的一类模型,用于设计、分析、验证和计吩炖估考试。它是一套壮大的生理丈量范式,宽泛利用于教育、生理学、人力资源等领域。IRT 解决了诸多关键丈量问题,如跨年等值、自适应考试设计及垂直量尺构建等。
IRT 是模型驱动的,即如果一个特定的数学方程,而后基于原始数据拟合模型,类似于线性回归。模型将人和标题置于统一个潜在量尺(通常称为 θ,theta)上,该量尺代表所丈量的特质(如智商、焦虑水平或特定知识)。IRT 曾被称为潜在特质理论和项目特点曲线理论。
Xcalibre 的作用:IRT 必要使用专门设计的软件。Xcalibre 提供了一个用户敦睦且可视化的平台,用于执行 IRT 分析。
?
为什么必要 IRT?
IRT 代表了生理丈量学的沉要创新。它不仅是分析考试数据的一种方式,更是驱动考试设计、构建、施测、计分和分析全周期的范式。IRT 的优势蕴含:
-
比经典丈量理论(CTT)更正确地评估考试分数
-
为被试提供更精准的反馈
-
通过差距项目职能(DIF)等技术削减工具误差
-
实现跨年等值,维持分数意思
-
支持垂直量尺构建(如跨年级课程衔接)
-
是实现自适应考试的必要前提
-
合用于多种考试体式(速度考试和难度考试均可)
IRT 必要较大的样本量和更深的领域知识(通常需博士级生理丈量学家),因而不合用于幼规模考试(如大学期末考),但全球险些所有大型考试均选取 IRT。
?
CTT 的局限性驱动 IRT 的发展
CTT 已有约百年汗青,因其单一向观,仍被宽泛利用。但其局限性蕴含:
-
统计量依赖样本,无法迁徙到分歧样本
-
统计量绑定于特定考试大局
-
不合用于稀少矩阵数据(如多大局、线性按需考试或自适应考试)
-
等值能力较弱
-
重要针对中等能力被试,对高、低能力被试丈量禁绝
-
未思考猜测成分
-
计分不依赖标题难度
-
不支持自适应考试
-
如果所有被试丈量误差一样(现实中并非如此)
-
如果标题与被试关系为线性(现实不成能)
IRT 较好地解决了上述问题。
?
IRT 的参数
对于二分计分题(正确/谬误),每个标题有三个参数:
-
a(分辨度参数):衡量标题分辨高、低能力被试的能力,通常领域 0~2,越高越好,但无数标题不超过 1.0。
-
b(难度参数):批示标题合用于哪一能力水平的被试,通常领域 -3~+3,0 代表均匀能力水平。
-
c(伪猜测参数):即项目反映函数的下渐近线,通常取 1/k(k 为选项数)。
这些参数共同界说了项目反映函数(IRF),暗示答题正确的概率随能力变动的曲线。例如,a≈1.0 批注分辨度尚可,b≈0.0 批注难度适中,c≈0.20 类似五选一的选择题。
凭据是否必要猜测,可选用三参数、双参数(a,b)或单参数(Rasch 模型,仅 b)。多分计分题(如里克特量表或部门计分题)则扩大模型以蕴含更多参数。
?
IRT 的现实利用示例
IRT 利用 IRF 实现多种用处,蕴含:
-
解读和改善标题机能
-
选取最大似然或贝叶斯步骤计分
-
考试组卷(蕴含线性按需考试和预等值)
-
推算被试分数的正确性
-
开发推算机自适应考试(CAT)
-
后等值
-
差距项目职能查抄(寻找误差)
-
数据取证(发现舞弊或其他问题)
此表,通过组合各标题标 IRF,可得到考试信息函数(TIF)和前提丈量尺度误(CSEM)。TIF 越高,暗示该能力区间丈量信息越多;CSEM 是 TIF 的倒数,可用于构建相信区间(如分数 ± 1.96×SEM)。
?
IRT 的如果
-
所丈量的潜在特质是单维的(若为多维,可使用多维 IRT 或别离处置)
-
标题间部门独立性(作答一题不受其他题影响)
-
正确作答概率由被试能力水平和模型参数决定,允许随机误差
?
IRT 的重要优势
-
量表样本独立性(分歧样本了局可在线性变换下转换到统一量尺)
-
统计量不绑定于特定考试大局
-
合用于稀少矩阵
-
更强的等值能力
-
能更好丈量高、低能力被试
-
支持垂直量尺
-
思考猜测成分
-
计分基于标题难度
-
支持自适应考试
-
误差估计因人而异
-
支持更强的考试组卷
-
不如果线性关系
?
IRT 模型家族
IRT 蕴含多种模型,凭据标题计分方式和维度划分:
单维模型
-
二分计分:Rasch 模型(1PL)、2PL、3PL、4PL
-
多分计分:Rasch 部门计分、Rasch 等级量表、广义部门计分、广义等级量表、分级响应模型
多维模型(每个标题涉及多个潜在因子)
-
赔偿型(一种能力可赔偿另一种)
-
非赔偿型(各能力均需较高水平)
-
双因子模型
多维 IRT 虽已存在数十年,但在现实中利用较少。
?
若何使用 Xcalibre 进行 IRT 分析
首先是获取尺度软件,贸易软件如 Xcalibre,也可使用 R 或 Python 中的包。软件会通过迭代循环拟合模型,并评估模型拟合度。
?
Xcalibre 输出示例(二分计分题):
-
标题编号、使用模型(如 3PL)、作答人数、正确率
-
经典分辨度(点二列有关)和 IRT 分辨度(a 参数)
-
难度(b 参数)、伪猜测(c 参数)
-
拟合统计量(卡方和 z-Resid),用于判断模型与数据匹配水平
?
Xcalibre 输出示例(多分计分题——广义部门计分模型):
-
显示各分数等级(如 0、1、2、3 分)的概率曲线
-
天堑地位(曲线交叉点)暗示分歧分数等级转化的能力阈值
-
援手判断标题各分数等级是否合理分辨分歧能力被试
?
?
?
- ?
-
2026-04-13
GMS 10.9 中文版正式颁布 — 新增 PFAS 运移仿照与地下水能量(GWE)?
GMS 10.9 中文版现已颁布。本次更新新增 MODFLOW-USG Transport 对 PFAS 运移仿照的支持、MODFLOW 6 地下水能量(GWE)模型、UGrid 多项改进以及 MODFLOW 6 界面优化等职能,为地下水数值仿照与地热储能分析提供更多工具支持。
查看详情 >
-
2026-03-26
Origin 2026 SR1 服务更新包颁布
Origin 2026 服务更新包1现已颁布,合用于更新现有Origin或OriginPro 2026 SR0装置或全新装置。本次更新建改了智能填充、Excel公式、分组画图批量操作及归并图形兼容性等多处问题,并解决了部门崩溃谬误。装置后版本号将升级到10.3.0.197,用户可通过“援手:关于Origin”确认更新实现。
查看详情 >
-
2026-03-10
GTAP数据库 V12已正式颁布 - 附视频介绍
GTAP(Global Trade Analysis Project)是一个设立在美国普渡大学农业经济系的经济钻研组织。该项目成立于1992年,旨在为业务政策分析和可推算通常平衡(CGE)建模提供数据支持。全新版GTAP V12已于2026年2月正式颁布,欢迎联系北京1xBET科技订购正版GTAP数据库。
查看详情 >
