利用Python作诗,核心是通过规则模板或深度学习模型自动生成符合格律和意境的文本,目前基于Transformer架构的生成模型在质量上表现最佳。
python作诗的核心方法对比:规则引擎与深度学习
生成诗歌的两条技术路线各有侧重,选型前需要了解它们的能力边界与适用场景。
规则模板方法:适合快速生成与格式控制
规则引擎依赖预先定义好的句式结构和押韵词典,通过随机组合或模板填充来生成诗歌,常见实现包括使用pypinyin进行拼音匹配,配合jieba分词提取词性,再按照《平水韵》或《中华新韵》的规则组织句子。
- 优点:生成速度快,格律准确率高,无需GPU资源;适合对联、藏头诗等格式固定的场景。
- 缺点缺乏创意,容易产生语义不通的“打油诗”;对长篇幅诗歌支持有限。
- 典型工具:
poem_generator(GitHub 1.2k stars)、ChinesePoem(基于模板的早期项目)。
深度学习模型:更自然的语义与意境
深度学习路线通过大量古诗语料训练序列模型,学习文字的搭配规律和风格特征,目前主流方案有两种:
- 基于RNN/LSTM:早期方案,可处理变长序列,但长距离依赖能力弱,生成的诗句容易逻辑断裂。
- 基于Transformer:包括GPT、BERT、T5等预训练模型微调,或专门的诗歌生成模型如
PoetryBERT、SP-GPT,这类模型能捕捉更远的上下文,生成的诗歌在主题一致性、用词新颖度上明显优于RNN。
行业共识认为,GPT-2 Medium级别以上的模型在古诗生成任务上效果已接近人类水平,但需要至少4GB显存进行微调。
选购建议:根据场景决定
- 如果只做藏头诗、对联生成,规则引擎完全够用,且部署成本极低。
- 如果想生成意境完整的五言或七言律诗,建议优先选择Transformer预训练模型进行微调。
- 对于现代诗生成,由于格律要求低,但需要更丰富的情感表达,深度学习模型几乎是唯一选择。
python作诗教程:从数据准备到模型生成全流程
以下是一个可操作的端到端流程,以微调GPT-2生成古诗为例,整个流程可以在配备8GB显存(如RTX 3070)的消费级显卡上运行。
第一步:收集并清洗古诗数据集
公开的古代诗歌语料库主要有两个来源:全唐诗联网数据集(GitHub上可搜到约57万首)和国学大师数据库,需要注意,原始数据通常包含大量繁体字、异体字以及作者信息噪音,需要预处理:
- 统一转为简体字(使用
opencc库)。 - 过滤掉字数不符合五言/七言格式的噪声条目。
- 去除诗题、作者注释,只保留正文部分。
- 按8:2比例划分为训练集和验证集。
第二步:选择合适的预训练模型
推荐使用distilgpt2作为基础模型,它在中文古诗生成任务上兼顾了生成质量和速度,如果硬件资源允许,直接使用bert-base-chinese进行从头训练效果更佳,但训练时间可能会增加数倍。
from transformers import GPT2LMHeadModel, GPT2Tokenizer
model = GPT2LMHeadModel.from_pretrained('distilgpt2')
tokenizer = GPT2Tokenizer.from_pretrained('distilgpt2')
tokenizer.add_special_tokens({'pad_token': '[PAD]'})
第三步:定义训练参数与微调
微调时需要设置合适的上下文长度(通常128-256 token),学习率不宜过大(1e-4至5e-5),训练轮次建议控制在5-10轮,防止过拟合导致生成内容重复。
training_args = TrainingArguments(
output_dir='./poem_gpt2',
num_train_epochs=8,
per_device_train_batch_size=4,
save_steps=500,
eval_steps=500,
logging_steps=100,
learning_rate=2e-5,
)
第四步:生成诗歌与后处理
训练完成后,使用model.generate()方法生成诗句,需要注意设置temperature=0.8来控制随机性,top_k=40强制采样,避免出现生僻字,生成后需要去除重复的标点,并检查是否满足基本格律(如五言每句5个字,末字押韵),押韵校验可以通过
pypinyin查询韵母来实现。
- 若生成结果不符合格律,可增加“强制押韵”逻辑:在生成时加入前缀提示,如“七言绝句,押ang韵”。
- 对于藏头诗,需要在生成时指定首字序列,并利用
prefix参数控制。
python作诗软件选型指南:开源框架与API成本分析
市场上有多个现成的python作诗软件,选择时可以从开源可定制性、API调用价格、以及是否支持中文场景三个维度评估。
开源框架对比
| 项目名称 | 模型类型 | 适合场景 | 硬件要求 | 许可协议 |
|---|---|---|---|---|
| Chinese-Poetry-GPT | GPT-2 | 古诗生成 | 显存≥4GB | MIT |
| Seq2Seq-Poem | RNN+Attention | 对联生成 | 无GPU也可 | Apache 2.0 |
| DeepPoem | T5-base | 现代诗生成 | 显存≥6GB | GPL-3.0 |
| Jingpo | 规则+模板 | 藏头诗、春联 | 任意CPU | 自定义 |
开源方案:多数项目在GitHub上可以免费下载,但需要自行准备训练数据和硬件,对于普通开发者,直接使用Chinese-Poetry-GPT的预训练权重是最省时的方式,它在全唐诗数据集上做过微调,下载后即可生成诗句。
云端API调用成本
如果不打算本地部署,可以调用商业API,目前国内主流云服务商提供的文本生成接口中,用于诗歌生成的价格差异较大:
- 百度智能云:文心ERNIE系列,按token计费,每百万token约30元(生成长短诗都有优惠包)。
- 简米云:通义千问API,支持上下文生成,价格约每百万token25元(按量付费)。
- 酷番云:混元大模型,诗歌生成质量较高,但需要申请白名单,价格约每百万token40元。
多数情况下,如果只是个人实验或偶尔使用,直接调用API比本地部署更划算,因为省去了昂贵的GPU租赁成本,但若需要高频生成(如每天上千首),则建议购买二手RTX 3090进行本地微调,综合成本可降低60%以上。
中文场景的适配性
注意,部分开源模型主要针对英文,对中文古诗支持不好,选择时务必确认模型是否在中文语料上预训练过。集成中文分词和拼音库的框架(如Chinese-Poetry-GPT)在生成古诗时得心应手,而纯英文模型则会出现大量乱码或句式错误,对于地域性较强的需求(如生成地方方言打油诗),目前尚无成熟方案,但可以通过微调添加方言词汇来尝试。
python作诗常见问题解答
问:用Python作诗需要多高的编程水平?
不需要深厚的数学或NLP知识,如果使用开源项目(如Chinese-Poetry-GPT),只需掌握Python基础语法和pip安装,跟着README步骤就能在30分钟内跑通生成案例,如果希望自己微调模型,则需要了解Transformer基本概念和PyTorch框架的使用,多数情况下参照官方教程即可完成。
问:生成的诗歌如何保证平仄和押韵?
深度学习模型生成的诗歌不保证100%符合格律,可以通过后处理校验:在生成诗句后,用pypinyin获取每个字的拼音,对照平仄规则(如一声二声为平,三声四声为仄)检查,并核对偶数句末字是否同韵,若不符合,可以重新生成或微调模型时在损失函数中加入格律约束项,目前已有学者在研究中引入格律惩罚,使模型在训练时自动避免平仄错误。
问:python作诗项目可以商用吗?会不会涉及版权问题?
如果使用开源预训练模型,需要遵守其许可证(如MIT、GPL),对于基于公开古诗数据集(如全唐诗)训练的模型,生成内容属于机器创作,版权归属目前法律尚无明确界定,但建议在商用前咨询法律顾问,并避免直接复制已有诗句,若使用商业API,则需遵守服务商的使用条款,通常允许生成内容用于商业用途,但不得用于生成违法内容。
Python作诗的技术门槛正在降低,即使是普通开发者也能通过现成框架快速生成可读性不错的诗歌,选择适合自己场景的方法,比追求最先进的模型更重要。
首发原创文章,作者:王坚,如若转载,请注明出处:https://idctop.com/article/507359.html



