产品推荐 2026-07-26

couplet-dataset:免费的对联数据集工具

提供超过70万条清洁对联数据,用于训练AI对联生成模型。

开源软件Linux工具

产品简介

couplet-dataset 这是一个对联数据集,包含超过70万条已清理的对联,适用于训练seq2seq模型来生成对联。解决了中文对联数据稀缺和清洗困难的问题,适合机器学习研究者和自然语言处理开发者使用。

核心功能

  • 数据量超过70万条对联
  • 数据经过清理,可直接用于模型训练
  • 提供训练集和测试集文件
  • 包含词汇表,支持seq2seq模式
  • 也可从HuggingFace获取

快速开始

  1. 访问指定链接下载couplet.tar.gz文件
  2. 解压文件到本地目录
  3. 使用train/in.txt和train/out.txt进行模型训练

界面预览

与其他方案对比

对比项couplet-dataset同类方案
数据量超过70万条清洁对联其他数据集可能数据量较少或未清洗
易用性提供格式化数据,直接可用于训练需要自行爬取和清洗数据

适合谁用

  • 需要训练对联生成模型的机器学习研究者
  • 开发中文NLP应用的软件工程师
  • 学习自然语言处理的学生

下载与版本

当前最新版本为 1.0,发布于 2018-02-24。支持 Linux。点击页面「下载软件」按钮即可下载打包好的版本,根据你的电脑/手机系统来选择对应的软件。

注意事项

  • 本工具仅供学习和研究使用,请遵守相关法律法规。
  • 请尊重内容创作者版权,勿将下载内容用于商业或非法传播。
  • 项目源码地址:https://github.com/wb14123/couplet-dataset