You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

调用Sentence Transformer encode触发TypeError:float对象不可下标访问

错误分析与解决方案

核心错误原因

报错TypeError: 'float' object is not subscriptable来自两个关键问题:

1. 输入数据类型不匹配

df1.processed_activities列中存在float类型的值(比如NaN),而SentenceTransformer.encode()要求输入为字符串或字符串列表。当传入float值时,模型的tokenize逻辑会误将其当作待拆分的文本元组,尝试执行text_tuple[0]操作,从而触发“float不可下标访问”的错误。

2. 对DataFrame列的处理逻辑错误

代码中model.encode(str(df2[col]))将整个DataFrame列(Series对象)直接转为字符串,得到的是类似"0 文本1\n1 文本2\n..."的格式,这并非实际需要的列中文本内容,同时也会导致模型编码错误。

额外语法错误

最后赋值时的max_sim_col0是笔误,应为max_sim_col。

修正后的代码

import torch
import numpy as np
from sklearn.metrics.pairwise import cosine_similarity
from sentence_transformers import SentenceTransformer

device = 'cuda' if torch.cuda.is_available() else 'cpu'
model = SentenceTransformer('sentence-transformers/all-MiniLM-L6-v2').to(device)

def get_similarities(df1, df2):
    similarity_scores = []
    # 清理processed_activities列的非字符串值,转为空字符串避免报错
    processed_activities = df1.processed_activities.fillna("").astype(str)
    
    for activity in processed_activities:
        # 确保输入为字符串类型
        activity_embeddings = model.encode(activity, convert_to_tensor=True)
        activity_similarity_scores = []
        
        for col in df2.columns:
            # 将列中所有文本拼接为单个字符串(可根据需求调整聚合逻辑)
            col_text = " ".join(df2[col].fillna("").astype(str).tolist())
            col_embeddings = model.encode(col_text, convert_to_tensor=True)
            
            # 跨设备兼容的余弦相似度计算
            similarity = cosine_similarity(
                activity_embeddings.cpu().numpy().reshape(1, -1),
                col_embeddings.cpu().numpy().reshape(1, -1)
            )
            activity_similarity_scores.append(similarity.item())
        
        similarity_scores.append(activity_similarity_scores)
    return similarity_scores

# 获取相似度分数
similarity_scores = get_similarities(df, specialties_data)

# 获取每个activity对应的最高相似度列
max_sim_col = []
for sim_scores in similarity_scores:
    max_sim_col.append(specialties_data.columns[np.argmax(sim_scores)])

# 添加结果列到原DataFrame
df['max_similarity_column'] = max_sim_col

df.to_csv("final.csv", index=False)
print(df)

关键修正点说明

  • 数据清洗:对df1.processed_activities列做空值填充和类型转换,确保所有输入都是字符串。
  • 列文本聚合:将df2的列内容拼接为单个字符串(若列本身是单条文本,可直接用df2[col].iloc[0]替代拼接逻辑)。
  • 跨设备计算:将CUDA张量转为numpy数组,避免GPU/CPU设备不匹配导致的计算错误。
  • 笔误修正:将max_sim_col0改为正确的max_sim_col。

内容的提问来源于stack exchange,提问作者Yasmine Daly

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.23 02:43:20