• 个性化智慧教育产品与服务提供商
  • 资讯中心
  • 当前位置: 主页 > 资讯中心 >

    一位小学语文教师的评价探索手记:当课堂表现性评价遇上AI助手

    发表时间:2026-07-27 03:40:04

    来源 | AI数智教研员教育内容创作中心

    本文约3100字,阅读需5分钟

    不少小学教师都有过这样的困惑:期末复习阶段,面对一叠叠练习卷和检测题,一边批改一边忍不住想——“这些分数真的能说明学生学得怎么样吗?那些在课堂上明明很活跃、很有想法的孩子,为什么一到书面检测就‘平平无奇’?”

    一位城区小学的语文教师,在教研组共读一份关于“课堂表现性评价”的材料时,被其中一句话击中了:表现性评价,是让学生运用自己的知识和技能完成一个复杂的综合性的任务,然后依据学生的各种表现进行评价。

    “原来评价可以不只是一张卷子。”她说。

    接下来的一个月,她和教研组的同事们一起,把表现性评价的四种类型——简答式、独立式、单元嵌入式、复杂项目——逐一放进了自己的语文课堂里试了一遍。而每一次尝试的背后,都有一位“不打烊的教研伙伴”在默默支撑。

    01 简答式:五分钟,看见思维的“小切口”

    简答式表现性评估的特点是:预期学习结果数量有限(通常一到两个),学生选择程度有限,完成时间通常只需要几分钟。

    这位教师第一次尝试,是在三年级的一节阅读课上。课文讲完后,她没有像往常一样让学生做课后填空题,而是出示了一道简答题:

    “请用一段话说明:作者为什么说‘雨后的森林像一幅水墨画’?你的回答里至少要用到两个表示颜色的词语。”

    这个问题只考察两个学习结果:提取关键信息的能力、运用颜色词进行描述性表达的能力。学生需要在几分钟内完成,答案虽然没有独有标准,但好的回答和一般的回答之间有明显区分。

    批改的时候,问题来了:全班四十多个孩子,每个人的表达方式都不一样。有的颜色词用得准确生动,有的泛泛而谈;有的能结合课文内容分析,有的只写了“因为很好看”就没了。凭感觉打分容易,但要给出有针对性的反馈,工作量太大了。

    这时候,教研组的一位同事提醒她:AI数智教研员的教学实施评价功能可以分析课堂实录中的师生对话,虽然这次是书面作答,但评价的逻辑是相通的——把评价维度先想清楚,再逐一对照。

    她打开AI数智教研员,用智能问答功能梳理了这道题的评分维度:颜色词的准确性与丰富度、与课文内容的关联度、表达的完整性与逻辑性。系统通过启发式追问帮她一步步细化标准——“什么样的颜色词算‘准确’?‘翠绿’和‘绿油油’哪个更好?如果学生只写了一个颜色词但表达特别精彩,怎么处理?”

    “以前我评这类题就是‘凭感觉给个勾或叉’。”她说,“现在我知道了,哪怕是五分钟的简答题,评价标准也可以很清晰。”

    她把梳理出来的评分维度做成了一张简单的量表,批改的时候逐一对照,给每个孩子的反馈从“写得不错”变成了“你的颜色词用得很准,下次试试再多写一句为什么”。孩子们拿到作业本,终于知道自己“好在哪里、差在哪里”。

    02 独立式:一节课的限时写作,怎么评才不“一刀切”?

    独立式表现性评估,通常涉及多个学习目标,在一到两节课内完成(最常见的是在一节课内完成),学生的选择程度往往仅限于回答内容,而不是回答的形式或过程。

    最常见的形式是限时写作。这位教师在四年级做了一次尝试:给出一段关于“家乡的老街”的描写性文字,让学生模仿其写法,用一节课的时间写一段关于“学校门口的早晨”的短文。

    这个任务考察的是观察能力、描写能力和模仿表达能力,多个目标交织在一起。但问题在于:有的孩子观察细致、词汇丰富,一节课能写满满一页;有的孩子憋了半天只写了三四行。如果只用“写得多就是好”来评价,对那些写得少但语言精炼的孩子不公平。

    教研组的集体备课上,大家用AI数智教研员的集体备课功能展开了讨论。系统自动记录了每位教师的发言:

    “我觉得应该先看有没有抓住‘早晨’的特点。”

    “描写顺序很重要,是从远到近还是从整体到局部?”

    “用到的感官描写——视觉、听觉、嗅觉——越多越好吗?”

    “三年级和四年级的标准应该不一样吧?”

    这些讨论在系统里自动生成了集备公案。团队在此基础上形成了一份分层的评价量表:基础层(能写出早晨的一个特点)、发展层(能按一定顺序描写、用到两种以上感官)、优秀层(描写生动、有个人观察视角)。

    有了这份量表,批改不再是“凭感觉给分”。更重要的是,她把量表提前发给了学生。“以前学生写作文就是闷头写,写完不知道自己能得几分、为什么得这个分。现在他们拿着量表就知道——‘哦,我要拿到优秀层,得做到这三条。’”

    AI数智教研员在这个过程中做了一件很实在的事:把散落在每个人脑子里的“我觉得应该这样评”变成了结构化的文字,让大家在同一个框架下对话,而不是各说各话。

    03 单元嵌入式:让评价“长”在教学过程里

    单元嵌入式表现性评估,是在一个教学单元内进行的。它要求学生展示一套复杂但连贯的知识和技能,完成时间可能跨越几天甚至一周。

    这位教师所在的教研组,在五年级上册“说明文”单元做了一次单元嵌入式评估的尝试。这个单元的学习目标是:了解说明文的基本特点,能运用列数字、作比较、打比方等说明方法写一段介绍性文字。

    传统的做法是:单元学完,出一张卷子考一考。但团队想换一种方式——让学生在整个单元的学习过程中,逐步完成一个“校园植物说明卡”的制作任务。

    第一课时:观察校园里的某一种植物,记录它的外形特点。

    第二课时:学习列数字、作比较等说明方法,把自己的观察记录改写成说明性文字。

    第三课时:互相交换初稿,根据“说明方法是否恰当、描述是否准确”的标准提出修改建议。

    第四课时:制作成图文并茂的说明卡,在班级“植物角”展示。

    这个过程中,评价不是集中在最后一张卷子上,而是镶嵌在每一个课时里。但问题也随之而来:四个课时的评价标准怎么统一?每个课时的重点不一样,怎么保证最终的评价是连贯的?

    团队用AI数智教研员的单元教学设计功能,输入五年级、说明文单元、单元嵌入式评估等参数,系统生成了一份评估框架,包括每个课时的评价要点、课时之间的逻辑衔接、以及最终的综合性评价量表。

    “系统给的不是现成方案,而是一份‘骨架’。”教研组长说,“我们在这个骨架上填进了自己的内容——校园里的植物是孩子们每天都能看到的,这个任务对他们来说有真实感。”

    更让团队惊喜的是,系统生成的框架里提示了一个他们之前没想到的维度:学生在完成任务过程中的自我反思。于是他们在第三课时之后增加了一个环节——让学生用一句话写“今天我大规模的收获是什么”。

    “以前我们只关心学生‘做没做出来’,不太关心他们‘怎么做的’。”一位教师说,“这个小小的提示,让我们看到了评价的另一个维度。”

    04 复杂项目:当语文课“长”出了跨学科的模样

    复杂项目的设计,是为了让学生参与要求他们利用多学科的不同知识和技能的任务。学生在项目进行过程中拥有相当程度的自主权,可以选择自己的主题、决定开展项目的方式。

    这是四种类型中最有挑战性的一种。这位教师的教研组在六年级尝试了一个“校园导览手册”项目。

    任务的起点很简单:学校要接待一批来访的兄弟学校师生,需要一份给访客看的校园导览手册。六年级的孩子们来负责编写。

    这个任务看起来是语文的“说明文写作”,但做起来就复杂了:

    要实地观察校园各个区域,记录位置、功能、特点——需要观察力和记录能力;

    要规划导览路线,考虑先后顺序和逻辑——需要空间思维和逻辑思维;

    要撰写各区域的介绍文字,做到准确、简洁、有吸引力——需要说明文写作能力;

    要配图、排版,制作成册——需要一定的美术和设计能力;

    要小组分工合作,协调进度——需要沟通和协作能力。

    “这不就是项目式学习吗?”教研组里一位年轻教师脱口而出。

    确实如此。但项目式学习的难点不在于“设计一个任务”,而在于“怎么在过程中给予恰到好处的支持”——既不能撒手不管,也不能什么都替学生做了。

    团队的做法是:用AI数智教研员的启发式引导功能,为每个小组配备了不同的“思考支架”。

    观察组不知道怎么记录?系统追问:“你要记录的是位置、样子,还是功能?哪一种对访客最有帮助?”

    写作组不知道怎么写才有吸引力?系统追问:“如果你是访客,你最想知道关于这个场所的什么信息?”

    规划组在路线顺序上争论不休?系统追问:“访客从校门进来,先看到什么、后看到什么,顺序合理吗?”

    “系统不会替学生写一个字、画一条线。”一位教师说,“但它会问问题——而那些问题,恰恰是学生需要自己去想清楚的。”

    项目进行到一半的时候,团队用AI数智教研员的教学实施评价功能对几个小组的课堂实录进行了分析。系统生成的理答行为诊断报告显示,教师在小组指导中存在一个共性问题:倾向于直接告诉学生“怎么做”,而不是通过提问引导学生自己找到答案。

    “这个发现让我们自己吓了一跳。”教研组长说,“我们明明知道要‘引导’而不是‘告诉’,但一忙起来就忘了。”

    基于这个发现,团队在后续的项目指导中刻意调整了回应方式。教师在AI数智教研员的辅助下,提前准备了每个关键节点的“引导问题清单”,走进小组之前先看一眼——今天在这个组,我要问哪三个问题?

    项目结束时,六个小组各自完成了风格不同的导览手册。有的侧重文字描述,有的图文并茂,有的甚至用手绘地图标注了每条路线的“看点”。评价的时候,团队没有用同一把尺子去量,而是让每个小组先自我评价——“我们觉得做得优质的地方是什么?下次可以改进的地方是什么?”然后教师再结合项目的整体目标给出反馈。

    “以前我们总担心‘没有统一标准会不公平’。”教研组长说,“这次试下来发现,当任务足够真实、过程足够开放的时候,每个孩子的闪光点是不一样的。评价的意义不是比出谁更好,而是让每个孩子都看见‘我哪里好’。”


    写在最后

    一个月的时间,这位教师和她的教研团队把四种表现性评价类型都试了一遍。从五分钟的简答题,到一节课的限时写作,到跨越一个单元的嵌入式评估,再到持续数周的复杂项目——每一种类型都有不同的设计思路,也都有不同的评价难点。

    但有一件事情是共通的:每一次设计评价任务之前,他们都会先用AI数智教研员把“评价到底要评什么”这个问题想清楚。

    “以前我们设计评价,经常是‘先想怎么做,再想怎么评’。”教研组长说,“现在顺序反过来了——先想‘我要看到学生什么样的表现’,再倒回去设计‘什么样的任务能让学生展现出这种表现’。”

    这个顺序的颠倒,恰恰是表现性评价的核心逻辑。而AI数智教研员的价值,或许正在于帮助教师把这个颠倒过来的逻辑,变成一个可操作、可重复、可持续的日常实践。

    当评价不再是一张冰冷的试卷,而是一个个鲜活的、真实的任务;当学生不再是被动接受评判的对象,而是主动展示自己所学的主体——课堂的样子,也许真的会不一样。