Skip to content

persona_1 部分 EEM 标准答案与自身来源矛盾 / string_contain 误判 / TLA 用会话记录日期替代真实发生日期 #1

Description

@owoWJY

在 persona_1 评测中发现以下数据/判分问题。

  一、EEM 标准答案问题
  ① session_20_eem_1 — 标准答案与自身解释/来源/元数据矛盾
  问:糖化血红蛋白最新检测结果?
  - answers.content = 8.8%
  - 但 explanation="从9.2%降至8.1%"、source_key_points.content="复查从9.2%降至8.1%"  、metadata.entity_value=8.1%
  - 三处均为 8.1%,唯独答案标 8.8%。正确答案应为 8.1%;现所有方法答 8.1% 全判错。

  ② session_40_eem_2 — string_contain 卡格式
  GT = "(++ ) "(带括号+空格)。答"尿酮体++""++"语义相同,却因不含该精确串被判错。

  ③ session_50_eem_2 — string_contain 卡词序/等价表述
  GT = "SAID(自身免疫性糖尿病)"。答"自身免疫性糖尿病(SAID/LADA)"语义正确(更完整),仅因缩写与全称顺序不同被判错。

  ④ session_100_eem_2 — 问题歧义 + 内部日期不一致
  问"2024年3月尿酮结果",GT 只收阴性(来源 2024-03-19)。但 3 月另有一条尿酮 (++)(2024-03-20,见 session_40_eem_2),两条都在 3
  月,问题未指定日期却只认一个。且该题 content 写 "2024-03-19"、time 字段写"2024-03-18",自相矛盾。

  二、TLA 用"会话记录日期"替代"真实发生日期"

  全部 TLA 题的标准答案都等于 source_key_points.time,而该 time 就是该知识点被记录的会话日期(随 session_id 单调递增)。对"何时被记录"类问题这没问题;但对问真实发生/起始时间的题,答案给的却是记录日期,二者被混为一谈。例如:session_10_tla_2 问"间歇性视力模糊最初出现于什么时间?",GT = 2024-01-05(=session1的会话日期),而来源内容只说"进入1月后出现"(真实起病时间模糊、可能早于首次提及)。session_80_tla_1 问"首次按完整方案开始联合使用 DPP-4 被记录在什么时候?",GT同样取首次提及的会话日期,而非真实开始用药日。

  即 TLA 实际考的是"该事在哪次会话被提到",而非"该临床事件真实发生在何时"。对纵向记忆系统,这两者是不同能力,用记录日期当唯一正确答案会误判正确回忆真实起病时间的模型。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Fields

    No fields configured for issues without a type.

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions