python adfuller是什么?,怎么用

在Python中,adfuller函数是时间序列平稳性检验的行业标准工具,它通过ADF检验量化序列是否存在单位根,是预测建模与统计分析前必须完成的关键步骤。

adfuller 函数的核心参数与调用方法

理解ADF检验与adfuller的关系

ADF(Augmented Dickey-Fuller)检验是判断时间序列平稳性的主流方法,而Python的statsmodels库中的adfuller函数正是该检验的官方实现,业内专家指出,adfuller已经成为金融、经济、传感器数据等领域最常用的平稳性检验工具之一,其核心思想是:通过构建回归模型,检验延迟项系数是否为零,若为零则存在单位根,序列非平稳。

python安装时的选中的launcher是什么?
加载中
python安装时的选中的launcher是什么?

参数说明:从入门到实际配置

调用adfuller时,需要理解三个关键参数,它们直接影响检验结果的可信度。

  • x(待检验序列):必须是一维数组或pandas Series,缺失值需提前处理,否则函数会报错。
  • maxlag(最大滞后阶数):控制回归模型中包含的滞后差分项个数,statsmodels官方文档建议,默认值基于样本量自动选择(如数据量小于100时用12/12(n/100)^1/4),但实务中常需手动调整,若maxlag过大,会损失自由度;过小则无法消除自相关,导致检验偏差。
  • regression(回归模型类型):可选'c'(仅常数项,默认)、'ct'(常数项+趋势项)、'ctt'(常数项+趋势项+二次趋势项)、'nc'(无常数项),行业共识是,金融资产收益率序列通常用'c',而GDP等宏观数据需用'ct',因为趋势项更符合实际走势。

如何选择滞后阶数:三种主流策略

滞后期选择不当,adfuller的p值会失真,以下是业内常用的三种方法,按场景推荐:

  • 基于信息准则自动选择:在adfuller中设置autolag='AIC''BIC',函数会自动遍历各阶数,选择信息量最小的值,这是最平衡的方案,适用于大多数探索性分析。
  • 手动设定固定阶数:如果已知数据采样频率(如月度数据用12阶),可直接传入maxlag=12,避免自动选择带来的不确定性,但需注意,固定阶数可能覆盖率不足,建议先用自相关图确认。
  • python adfuller是什么?,怎么用

    遍历后对比结果:在学术研究中,常对不同maxlag值分别运行adfuller,观察p值是否稳定,若在多个阶数下结论一致,则可信度更高,据统计,超过70%的实证论文会采用此方法作为稳健性检验。

adfuller 结果解读与实战案例

解剖输出结果:四个关键指标

adfuller返回一个包含五个元素的元组,但实务中只需关注前四个,它们直接决定结论。

  • ADF统计量:负值越小(越负),越倾向拒绝原假设,3.5比-2.8更显著。
  • p值:小于0.05(或0.01)时,在对应置信水平下拒绝“存在单位根”的原假设,即序列平稳,但需注意,p值对滞后阶数敏感,不同阶数下可能差异较大。
  • 临界值:1%、5%、10%三个水平下的临界值,若ADF统计量小于临界值,则拒绝原假设,若5%临界值为-2.86,而ADF统计量为-3.12,则说明在5%水平下是平稳的。
  • 滞后阶数样本量:前者是最终使用的滞后期,后者是有效观测数,这两个值用于验证检验是否合理,若样本量过小(如小于50),结果可能不可靠。

实战:检验股票收益率序列的平稳性

假设我们下载了某只股票近一年的日收益率数据,存为变量returns,下面是完整操作路径,每一步都可复现。

import pandas as pd
import numpy as np
from statsmodels.tsa.stattools import adfuller
# 准备数据,确保无缺失值
returns = returns.dropna()
# 运行adfuller,使用自动选择滞后期与仅常数项模型
result = adfuller(returns, regression='c', autolag='AIC')
# 提取关键指标
adf_stat = result[0]
p_value = result[1]
critical_values = result[4]
print(f'ADF统计量: {adf_stat:.4f}')
print(f'p值: {p_value:.4f}')
print('临界值:')
for key, value in critical_values.items():
    print(f'  {key}: {value:.4f}')
# 判定
if p_value < 0.05:
    print('在5%显著性水平下,序列平稳,拒绝单位根原假设')
else:
    print('序列非平稳,需进一步差分处理')

在实际项目中,如果p值大于0.05,通常会对收益率序列做一阶差分(即diff(1)),然后再次检验,据统计,金融价格序列的一阶差分多为平稳,这符合有效市场假说的基本结论。

常见误区:p值不能直接比较大小

python adfuller是什么?,怎么用

很多初学者误以为p值越小,平稳性越强,但行业共识认为,p值只是拒绝原假设的置信度,并非平稳程度的度量,平稳性检验只给出二元结论(是否平稳),不提供“平稳程度”的量化指标,若需比较不同序列的平稳性,应使用ADF统计量本身(越负越平稳),或结合KPSS检验的统计量。

adfuller 与其它平稳性检验方法的对比

KPSS检验:互补与差异

adfuller的原假设是“存在单位根”,而KPSS相反,原假设为“序列平稳”,行业共识推荐双检验策略:先用adfuller,再用KPSS,根据结果组合判断。

检验类型 原假设 适用场景 互补价值
adfuller 存在单位根(非平稳) 判断是否需要差分 若adfuller无法拒绝(非平稳),但KPSS也无法拒绝,则数据可能过于“模糊”
KPSS 序列平稳 确认差分是否过度 若adfuller拒绝(平稳),但KPSS也拒绝(非平稳),则可能存在趋势性平稳

据计量经济学教材,当adfuller的p值略高于0.05(如0.08),而KPSS的p值低于0.05时,应优先考虑序列是趋势平稳的,而非纯随机游走,此时可考虑去除趋势项而非直接差分。

适用场景选择:按数据量级决定

  • 样本量 > 500:adfuller和KPSS均可,但adfuller在小样本下的检验功效较差,此时KPSS更可靠。
  • 样本量 50-200:推荐结合使用,且优先选择包含趋势项的模型(regression=’ct’),因为小样本中趋势项容易被误判为随机游走。
  • 高频数据(如每秒记录):需注意adfuller对自相关假设敏感,最好先用ARIMA残差检验,或使用可处理异方差的单位根检验(如DF-GLS)。

adfuller 常见问题与解决方案

p值接近0.05,如何决策?

当p值在0.04-0.06之间时,不要直接下结论,建议执行以下操作:

  1. 更换滞后阶数选择方法(如从AIC换为BIC),观察p值是否稳定。
  2. 对序列进行差分后再次检验,若差分后p值显著降低(如0.001),说明原序列存在接近单位根的特征。
  3. 参考行业惯例:在金融领域,若p值在0.05-0.1之间,且序列存在明显趋势,很多分析师会按非平稳处理,先差分再建模,以消除虚假回归风险。
  4. python adfuller是什么?,怎么用

原始数据包含缺失值怎么办?

adfuller不接受NaN,有两种处理方式:

  • 前向填充:对时间序列缺失值,用最近有效值填充,适用于价格等连续数据。
  • 插值法:使用pandas的interpolate()方法,按线性或时间权重填充,更适合加速度、温度等物理量。

但需注意,缺失值比例超过20%时,任何填充都会引入偏差,建议先考虑数据采集是否完整。

调用adfuller时出现奇异矩阵警告

这通常是因为序列中存在常数(如全部为0)或重复值过多,导致回归矩阵不可逆,解决方案:先对序列做去重检查,或加入微小随机噪声(如np.random.normal(0, 1e-6, len(series)))后再检验。

Q&A:adfuller 相关高频问题

问题1:adfuller 的p值多少才算平稳?

通常以0.05为界,p值小于0.05则在5%显著性水平下拒绝“存在单位根”的原假设,认为序列平稳,应结合ADF统计量与1%、5%、10%临界值对比,若统计量小于临界值,则在对应水平下平稳,行业共识是,在金融时间序列中,p值小于0.01才算高度可靠,因为金融数据常存在特殊波动性。

问题2:adfuller 和 kpss 结果矛盾怎么办?

同时使用adfuller和KPSS时,会出现四种结果组合,若adfuller拒绝单位根(平稳)而KPSS拒绝平稳(非平稳),则序列可能是“趋势平稳”,即去除趋势后平稳,此时应使用差分还是去趋势,取决于建模目的,若两个检验都未拒绝(adfuller认为非平稳,KPSS也认为非平稳),则数据可能存在严重结构突变,需进一步使用突变点检验(如Zivot-Andrews)或更换数据清洗方法。

问题3:adfuller 在时间序列预测中必须用吗?

对于线性模型(如ARIMA、VAR),平稳性检验是强制前置步骤,因为非平稳数据会导致虚假回归和参数估计偏差,但对于深度学习模型(如LSTM、Transformer),部分研究表明模型能够自动学习趋势,开始跳过差分步骤,但行业共识仍建议在做任何预测前,先用adfuller确认序列性质,至少能避免因极端非平稳导致的训练发散问题。

首发原创文章,作者:王坚‌,如若转载,请注明出处:https://idctop.com/article/505958.html

(0)
Notebook Python怎么用?,有哪些实用技巧?
上一篇 2026年7月20日 13:26
如何快速有效反向寻找CDN真实IP?,有哪些工具?
下一篇 2026年7月20日 13:32

相关推荐

  • 服务器接收单是什么意思?服务器接收单怎么写?

    服务器接收单是企业IT运维与资产管理流程中至关重要的核心凭证,它不仅是硬件设备入库的物理确认,更是保障数据安全、厘清责任归属、规避运维风险的法律依据,一个规范、严谨的接收单流转机制,能够从源头上杜绝资产流失,确保服务器在全生命周期内的可追溯性,是构建高可用数据中心管理体系的第一道防线,核心结论:服务器接收单的本……

    2026年3月7日
    11100
  • 服务器操作系统价格是多少,企业服务器系统一年多少钱?

    服务器操作系统价格并非单一固定数值,而是取决于授权模式、版本类型、核心数量以及所需的技术支持服务,整体成本跨度从完全免费到每套数千美元不等,企业在进行IT预算规划时,不能仅看软件的表面授权费用,更需综合考量长期运维成本、安全更新及人员培训成本,目前主流的服务器操作系统市场主要由Linux发行版和Windows……

    2026年2月26日
    13400
  • hutchinson python是什么,有什么用?

    Hutchinson Python 是一种利用随机向量高效估计大型矩阵迹的算法实现,在深度学习和数值计算中广泛应用,它通过蒙特卡洛方法将计算复杂度从 O(n²) 降至 O(n) 级别,成为处理海量矩阵迹的关键工具,Hutchinson 迹估计原理与 Python 实现优势什么是 Hutchinson 迹估计Hu……

    2026年7月18日
    200
  • 谷歌公开的大数据分析平台是什么?有哪些主流大数据平台

    谷歌公开的大数据分析平台并非单一软件,而是以Google Cloud BigQuery、Looker Studio和Dataproc为核心的云端数据基础设施组合,它们通过无缝集成与Serverless架构,帮助企业实现从海量数据清洗到可视化决策的全链路自动化处理,在数字化转型的深水区,企业不再满足于简单的数据存……

    2026年7月3日
    1100
  • 个人域名转为公司域名怎么操作?个人域名变更为公司域名流程

    个人域名转为公司域名并非简单的技术过户,而是一场涉及品牌资产确权、税务合规及SEO权重迁移的系统性工程,核心在于完成主体变更的同时确保搜索引擎权重的平稳过渡,在2026年的数字商业环境中,域名早已超越了单纯的网址功能,成为企业数字资产的核心载体,许多创业者起步于个人名义注册域名,随着业务规模化,将域名主体变更为……

    服务器运维 2026年6月4日
    3500
  • 您的服务消息通知一直弹出影响使用怎么办,如何彻底关闭提醒

    写好服务消息通知的核心在于让用户一眼看到关键行动点,同时兼顾搜索可见性和信任度,这直接决定了用户体验和业务转化效率,服务消息通知怎么写才能提升转化率很多运营朋友经常问我:为什么同样一条通知,有的用户秒点,有的直接忽略?答案就在消息的结构和细节里,你需要在几秒内抓住用户的注意力,引导他完成你想让他做的事,消息结构……

    2026年7月16日
    200
  • 个人域名注册到底要多少钱?域名注册费用多少钱一年

    个人域名注册价格通常在20-100元人民币/年之间,具体取决于后缀类型、注册商优惠策略及续费标准,建议优先选择主流注册商的首年低价套餐并关注续费成本,在数字化生存成为常态的今天,拥有一个专属域名不仅是个人品牌的数字化名片,更是构建独立网络身份的基础设施,许多初次接触域名注册的朋友,往往被市场上参差不齐的价格迷惑……

    2026年6月10日
    3700
  • 服务器快照怎么用,服务器快照功能怎么使用教程

    服务器快照是数据安全与业务连续性的核心保障机制,其核心价值在于“一键还原”与“低成本试错”,正确使用服务器快照,能将系统故障恢复时间从数小时缩短至分钟级,是运维管理中不可或缺的“后悔药”,掌握快照的创建策略、保留周期与回滚流程,能最大限度降低误操作与系统崩溃带来的损失, 服务器快照的核心逻辑与应用场景快照并非简……

    2026年3月24日
    9200
  • 服务器搭建实例有哪些?新手如何从零开始搭建?

    构建一个稳定、高效且安全的服务器环境,并非简单的软件安装堆砌,而是一个涉及硬件规划、系统选型、安全加固及性能调优的系统工程,核心结论在于:服务器搭建的成功关键,在于根据业务需求精准匹配底层资源,并严格执行标准化的安全配置与运维流程,从而在保障数据安全的前提下,最大化系统的运行效率与稳定性,以下将从硬件规划、系统……

    2026年3月1日
    14000
  • 高级威胁检测系统如何选购,企业防黑客攻击买哪款好

    必须聚焦APT攻击链路的自动化阻断能力,严格匹配《网络安全等级保护2.0》与《关基保护条例》合规基线,并基于2026年AI驱动的实战攻防演练结果,优先选择具备高置信度威胁情报融合及全流量深度解析(DPI)能力的国产化架构产品,洞悉2026威胁态势,锚定核心检测需求攻防演变倒逼检测升级根据国家计算机网络应急技术处……

    2026年4月26日
    4500

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注