SPECTER 开源项目教程-CSDN博客

本文链接：https://blog.csdn.net/gitblog_00442/article/details/141385121

SPECTER 开源项目教程

specterSPECTER: Document-level Representation Learning using Citation-informed Transformers项目地址:https://gitcode.com/gh_mirrors/spe/specter

项目介绍

SPECTER（Scientific Paper Transformer）是一个由Allen Institute for AI开发的开源项目，旨在通过深度学习模型来评估和生成科学论文之间的相似性和相关性。SPECTER利用了BERT模型的变体，专门针对科学文献进行了预训练，使其能够理解和处理科学领域的文本数据。

项目快速启动

环境准备

首先，确保你已经安装了Python 3.6或更高版本。然后，克隆SPECTER的GitHub仓库并安装所需的依赖包：

git clone https://github.com/allenai/specter.git
cd specter
pip install -r requirements.txt

模型下载

下载预训练的SPECTER模型：

wget https://ai2-s2-research.s3-us-west-2.amazonaws.com/specter/archive.tar.gz
tar -xzf archive.tar.gz

示例代码

以下是一个简单的Python脚本，用于加载SPECTER模型并计算两篇论文的相似度：

import torch
from transformers import AutoTokenizer, AutoModel

# 加载tokenizer和模型
tokenizer = AutoTokenizer.from_pretrained('allenai/specter')
model = AutoModel.from_pretrained('allenai/specter')

# 示例论文数据
paper1 = {"title": "A new method for data analysis", "abstract": "This paper introduces a novel approach to data analysis."}
paper2 = {"title": "An improved data analysis technique", "abstract": "This paper presents an enhancement to existing data analysis methods."}

# 合并标题和摘要
text1 = f"{paper1['title']} {paper1['abstract']}"
text2 = f"{paper2['title']} {paper2['abstract']}"

# 编码文本
inputs1 = tokenizer([text1], padding=True, truncation=True, return_tensors="pt")
inputs2 = tokenizer([text2], padding=True, truncation=True, return_tensors="pt")

# 获取嵌入向量
with torch.no_grad():
    embeddings1 = model(**inputs1).last_hidden_state.mean(dim=1)
    embeddings2 = model(**inputs2).last_hidden_state.mean(dim=1)

# 计算余弦相似度
cosine_sim = torch.nn.functional.cosine_similarity(embeddings1, embeddings2, dim=1)
print(f"Cosine Similarity: {cosine_sim.item()}")