WikiAnswers 是一个英语自然语言问题数据集,从WikiAnswers 网站上抓取的相同问题的不同表述形式,包括 250 万个不同问题和 1800 万个问题复述对。 问题:         What are the green blobs in plant cells?问题复述:         a green substance in the plant cell be the ?         be cytoplasm a green cell part in certain plant cell ?         package of green coloring in plant cell ?         part of the plant cell where the cell get it green color ?         the green part in a plant be call ?         the green part of a plant cell ?         the part of the plant cell that make the plant green be call ?         what be green part call ?         what be green part in plant cell ?         what be the green body in a plant cell ?         what be the green machine within a plant cell ?         what be the green part of a plant cell ?         what be the green part of plant cell ?         what be the green substance in plant cell ?         what be the name of the green thing in the plant cell ?         what be the part of plant cell that give it green color ?         what be the part of the cell that produce the green color of the plant ?         what be the part of the plant cell that make the green color ?         what be to part of the plant cell ?         what cell part do plant have that enable the plant to be give a green color ?         what in a plant cell that be green ?         what part of the cell be large and green ?         what part of the plant cell turn it green ?
1
中文医疗问答数据-好大夫.zip
2021-08-27 18:07:08 853.12MB 问答数据 医疗
1
美国知识问答网站 Quora 上的问题答案数据集,可用以进行重复问题检测。
2021-07-05 13:06:12 20.36MB 自然语言理解 NLP 问题答案匹配
1
来自某在线求医产品的中文医患对话数据。原始描述:The MedDialog dataset contains conversations (in Chinese) between doctors and patients.
1
队 为斯坦福问答数据集建立质量保证体系( ) 请阅读此博客以获取详细信息: : 第一个文件create_emb.ipynb负责为训练数据集的Wikipedia文章中的所有句子和问题创建一个嵌入句子的字典。 第二个文件unsupervised.ipynb使用句子嵌入来计算句子和问题之间的距离,基于欧几里得和余弦相似度。 最后,它从距问题最短距离的每个段落中提取设置。 目前,它们的准确度分别为45%和63%。 最后一个文件将此问题视为监督学习问题,其中我拟合多项逻辑回归,随机森林和xgboost并创建20个特征-(2个特征代表一个句子的余弦距离和欧几里得。我将每个段落限制为10个句子)。 目标变量是具有正确答案的句子ID。 所以我有10个标签。 目前,这分别提供了63%,65%和69%的准确性。 未来工作:使用RNN获得确切答案
2021-05-06 16:59:37 9.23MB 系统开源
1
# Chinese medical dialogue data 中文医疗对话数据集 ### Data_数据中有6个文件夹分别是: >**** 94596个问答对 > **** 220606个问答对 **** 183751个问答对 **** 75553个问答对 **** 101602个问答对 **** 115991个问答对 总计 792099个问答对
2021-04-15 22:17:22 144.11MB NLP 数据集
1
中文医学问答数据集 数据集描述:中文医药方面的问答数据集,超过10万条。 数据说明:questions.csv:所有的问题及其内容。answers.csv :所有问题的答案。 train_candidates.txt, dev_candidates.txt, test_candidates.txt :将上述两个文件进行了拆分。
1
中文医药方面的问答数据集,超过10万条。数据说明:questions.csv:所有的问题及其内容。answers.csv :所有问题的答案。 train_candidates.txt, dev_candidates.txt, test_candidates.txt :将上述两个文件进行了拆分。
1
通过BeautifulSoup库的ask120爬虫代码,分为科室链接爬取,问答链接爬取,问答详情爬取、医生信息爬取三个部分。
2019-12-21 21:11:57 13KB 医疗问答数据
1
小黄鸡50W条问答对话,都是中文,可供训练闲聊机器人试用。
2019-12-21 21:11:13 23.33MB 问答数据集
1