Python的pickel模块(标准库中正式名称为pickle,但常被误拼为pickel)是处理对象序列化与反序列化的核心工具,能将几乎任何Python对象转换为字节流并完整恢复,但在安全性上存在显著隐患,不适合处理来自不可信来源的数据。
python pickel 是什么?它解决的核心场景
Python程序运行时,对象存在于内存中,一旦程序结束,这些对象就消失了,如果你希望把一个复杂的对象保存下来,下次启动时直接加载,或者通过网络传输给另一个Python进程,就需要序列化,pickel(即pickle)正是为此设计的协议。
它能把任意Python对象(包括嵌套结构、自定义类实例)转化为字节流,这个过程叫序列化;反过来从字节流恢复对象,叫反序列化,常见的应用场景包括:
- 保存机器学习模型的训练结果,下次直接加载使用
- 缓存大量计算后的数据,避免重复计算
- 在分布式系统中传输Python对象
- 游戏存档,将游戏状态完整保存
与JSON等文本格式不同,pickel是Python专属的二进制协议,支持的数据类型更广,但跨语言无法使用,行业共识认为,在需要保留Python对象完整状态且不涉及跨语言通信时,pickel是最高效的选择。
python pickel 怎么用?核心操作与实例
序列化:dump 和 dumps
dump将对象序列化并写入文件,dumps则返回字节串,常用写法:
import pickle
data = {'name': 'Alice', 'scores': [95, 87, 92], 'model': LinearRegression()}
# 写入文件
with open('data.pkl', 'wb') as f:
pickle.dump(data, f)
# 得到字节串
bytes_data = pickle.dumps(data)
注意文件打开模式必须为二进制写模式wb。
反序列化:load 和 loads
从文件或字节串恢复对象:
with open('data.pkl', 'rb') as f:
loaded_data = pickle.load(f)
# 从字节串恢复
original = pickle.loads(bytes_data)
反序列化时,Python会重建对象,包括调用类构造函数、恢复属性等,这也是安全风险的根源。
进阶:协议版本与优化
pickel支持多个协议版本,从协议0(文本风格)到协议5(Python 3.8+),高版本效率更高,但兼容性受限,通常使用pickle.HIGHEST_PROTOCOL自动选择最高版本:
pickle.dump(data, f, protocol=pickle.HIGHEST_PROTOCOL)
对于大型数据,可以使用pickle.DEFAULT_PROTOCOL,或者指定固定版本以保证跨Python版本兼容。
python pickel 和 json 哪个更合适?
这是许多开发者纠结的问题,关键看需求:
| 对比维度 | python pickel | JSON |
|---|---|---|
| 支持的数据类型 | Python几乎所有对象,包括自定义类、函数、循环引用 | 基本数据类型:字符串、数字、列表、字典、None |
| 可读性 | 二进制,不可读 | 纯文本,易读 |
| 跨语言 | 仅限Python | 几乎所有语言 |
| 安全风险 | 反序列化可执行任意代码,风险高 | 安全,只解析数据 |
| 速度 | 二进制协议,通常较快 | 文本解析,相对较慢 |
| 数据体积 | 较小(二进制) | 较大(文本) |
使用建议:如果你需要保留Python专属对象(如numpy数组、自定义类实例),且数据只在Python内部流转,pickel是首选,如果数据需要与前端、其他语言交互,或者对安全性要求高,应该用JSON,多数情况下,对于简单的字典、列表,JSON更安全通用。
一次典型的场景:在本地调试机器学习模型时,pickel可以快速保存和恢复整个模型对象;而作为API接口返回数据,JSON是标准做法。
python pickel 的安全风险与防范措施
风险:反序列化任意代码执行
pickel的序列化本质上是记录对象的构造方式,反序列化时会自动执行对象的__reduce__方法,攻击者可以构造恶意的pickel字节流,在反序列化时执行系统命令,
import pickle, os
class Exploit:
def __reduce__(self):
return (os.system, ('rm -rf /',))
# 如果反序列化上面这个对象,就会执行删除命令
pickle.loads(exploit_bytes)
这并非理论漏洞,现实中已有大量攻击案例。绝对不要对来自不可信来源的pickel数据调用load或loads,包括用户上传、网络传输未签名、日志文件中的二进制块。
防范措施
- 限制数据来源:只从可信路径加载pickel文件,如本地系统生成、TLS传输的受控端点。
- 使用数字签名:在序列化时附加HMAC签名,反序列化时先验证签名完整性。
- 替代方案:在需要安全交互的场景,改用JSON、MessagePack、Protocol Buffers等格式。
- 配置安全限制:可以自定义Unpickler,限制允许恢复的类列表,但这种做法维护成本高,且容易遗漏。
业内专家指出,目前没有任何简单的方法能完全安全地反序列化任意pickel数据,最根本的防护就是“不信任任何外来pickel”。
python pickel 常见问题与解决方案
问题1:反序列化时出现 AttributeError: Can’t get attribute ‘xxx’
这是最常见的问题,原因通常是原始类定义被修改、移动或删除,pickel序列化的是类名和模块路径,反序列化时需要在当前环境中找到相同的类定义。
解决方案:
- 确保反序列化时使用的类定义与序列化时一致(包括模块名、类名、属性结构)。
- 如果类定义需要更新,可以编写自定义的
__setstate__和__getstate__方法控制序列化内容。 - 对于临时调试,可以先用
pickle.loads的fix_imports参数尝试兼容旧版本。
问题2:pickel 文件版本兼容性
Python 2和Python 3的pickel协议不兼容,Python 2生成的pickel文件在Python 3中可能无法直接加载,反之亦然。
解决方案:
- 在Python 3中加载Python 2生成的pickel时,指定
encoding='latin1'、fix_imports=True等参数,但仍有部分对象无法转换。 - 最佳实践是统一使用Python 3的协议,并避免在Python 2/3混合环境中使用pickel,如果必须跨版本,考虑使用JSON或dill等库。
问题3:pickel 文件过大,加载慢
大型对象或大量数据时,pickel的读写速度可能成为瓶颈。
解决方案:
- 使用
protocol=pickle.HIGHEST_PROTOCOL减少体积。 - 对于大型numpy数组,使用专用的
np.save或joblib.dump,它们在底层对数组优化更好。 - 考虑分块序列化,将大对象拆分为多个小对象分别存储。
pickel 是利器也是双刃剑
pickel为Python对象持久化提供了极高的便利性,尤其在机器学习、数据科学和快速原型开发中不可或缺,但它的安全性缺陷决定了它只能在绝对可控的环境中使用,理解它的原理、版本与风险,才能在项目中正确决策。如果你不确定数据来源是否安全,就不要用pickel先用JSON或其他干净的序列化方案。
python pickel 常见问题解答
python pickel 可以序列化所有Python对象吗?
不能,典型的不可序列化对象包括:文件句柄、网络连接、数据库连接、生成器对象,以及某些C扩展类型,但通过实现__getstate__和__setstate__方法,可以手工控制序列化内容,使部分对象变相支持序列化,对于大多数自定义类实例,只要其属性不是不可序列化类型,都可以直接使用pickel。
python pickel 和 cPickle 有什么区别?
在Python 2中,cPickle是C语言实现的pickle,速度更快,Python 3中,pickle模块本身已经用C重写,cPickle被废弃,直接使用import pickle即可获得高性能,现在不需要再区分两者,pickle就是最优实现。
python pickel 反序列化时报错 “EOFError: Ran out of input” 怎么解决?
这个错误通常表示pickel文件已损坏或不完整,也可能是文件为空,常见原因:文件写入时进程被中断,或者在读取时使用了错误的模式(如文本模式r而非二进制模式rb),检查文件大小是否为零,确认写入和读取时都使用'wb'和'rb'模式,如果文件来自网络传输,先验证文件完整性(如MD5校验)。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/511817.html



