HealthBench
HealthBench是OpenAI推出的开源医疗评估工具,用于衡量大型语言模型在医疗保健领域的表现和安全性。它包含5000个由医生设计的多轮对话,涵盖多种健康场景,并通过多维度评分标准评估模型的准确性、沟通质量等。支持按主题和行为维度进行细分分析,帮助开发者识别模型优势与不足,指导优化方向。适用于模型性能评估、安全测试及医疗AI工具选择。
MagicSchool
MagicSchool是一款面向教育领域的AI平台,提供课程规划、视频问题生成、行为干预方案制定和内容创作等功能,帮助教师提高教学效率与质量。平台支持多语言操作,内置80多种AI工具,适用于课堂教学、备课、学生个性化支持及家校沟通等多种场景,具备良好的实用性与扩展性。
Claude Computer Use
Claude Computer Use 是 Anthropic 公司推出的 AI 辅助工具,利用自然语言指令驱动 AI 模型执行计算机操作,包括屏幕阅读、文本输入、文件管理、网页浏览及软件操作等功能。该工具支持自动化脚本执行和代码编写调试,广泛适用于软件开发、数据处理、客户服务、教育等领域,具有高度智能化和灵活性的特点。
