最新动态
每天 8:00 UTC 自动更新 · AI 大模型与智能体前沿动态
比尔·盖茨:AI危险阈值已过,我们该怎么办?
华盛顿州柯克兰市,一个阳光明媚的日子。这是西雅图富裕的郊区,位于华盛顿湖东岸。气温在华氏80多度(约摄氏30度),天空蓝得不能再蓝。从Gates Ventures的会议室望出去,可以看到Carillon Point码头,那里停泊着一队昂贵的船只,湖对岸是奥林匹克山脉,勾勒出地平线。景色美不胜收,但隐约令人恐惧。因为如果景色是平静的,传递信息的人却不是。坐在我对面的会议室桌旁,比尔·盖茨在椅子上前后
阅读全文ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent
阅读全文冷战密码破译巨兽:IBM为NSA打造的Harvest超级计算机
在冷战高峰期,一台极其专业的计算机因其高度机密性,以至于世界根本不知道它的存在。它的运行速度比同时代任何其他计算机快达200倍。从1962年古巴导弹危机时期开始,历经越南战争,直至1975年赫尔辛基协议之后,它一直是美国国家安全局(NSA)的主要密码处理核心。这台机器直到其活动部件最终报废才停止运行。Harvest计算机之所以重要,不仅在于其运行的时代,更在于其本身的特性。在长达14年的时间里,当
阅读全文LLM智能体利用仿真模型进行受控实验
大型语言模型(LLMs)在推理、规划和工具使用方面展现出强大的能力,但许多科学和工程任务不仅仅需要生成合理的文本和代码。这些任务要求理解系统对干预的响应方式,而这在实践中依赖于受控实验。在本工作中,我们提出了一种多智能体框架,使LLM智能体能够利用科学仿真模型进行受控实验,以用于制药工艺设计。给定用户查询和基线配置,该系统构建结构化的任务表示,设计实验,执行比较仿真,解释结果,并为工艺参数优化综合
阅读全文美国过半成人自认缺乏基础统计理解能力
根据宾夕法尼亚州立大学研究员领导的一项新研究,许多美国成年人表示,如果他们对统计有更好的理解,他们会更频繁地使用统计。该研究由宾夕法尼亚州立大学健康政策与管理助理研究教授马克·拉莫斯(Mark Ramos)领导。拉莫斯指出,从每日天气预报到棒球运动员的击球率,再到个人患肺癌的风险,理解统计可以帮助美国人更好地应对日常生活。然而,根据拉莫斯领导的最新研究,超过一半的美国成年人表示对基础统计概念知之甚
阅读全文RENDER:控制LLM记忆评估中的读者可见证据
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风
阅读全文隐藏规则游戏中的AI学习与概念迁移
本报告总结了在隐藏规则游戏(Game of Hidden Rules, GOHR)上进行的工作,重点关注通过试错反馈推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化能力以及伪机器人辅助的人类学习分析。报告重点介绍了基于Transformer的A2C框架、特征中心(Feature-Centric)和对象中心(Object-Centric)表示、实验结果以及人类学习数据的分类。
阅读全文AIREP:AI运行时治理中逐决策证据的协议
本文提出了一种用于记录自动化AI运行时治理决策的协议。当运行时对单个输出进行发布、阻止、延迟、编辑或升级处理时,AIREP将该决策记录为单个签名对象,任何一方都可以离线检查该对象,而无需依赖生成该对象的运行时。每条记录将决策表示为在既定政策依据下的封闭动词集合中的一个动词,通过哈希而非值来引用其输入、输出和证据,并声明其证据覆盖的内容以及未覆盖的内容。记录形成SHA-256哈希链,将每条记录绑定到
阅读全文KVBoost:基于偏差引导重算的分块键值缓存复用技术,实现高效大语言模型推理
基于Transformer的大语言模型(LLM)在推理过程中面临高预填充延迟问题,因为每个请求都需要重新计算键值(KV)张量。现有的前缀缓存系统虽然能降低这一成本,但要求提示词共享一个连续的前缀,这限制了共享内容出现在任意位置时的复用效果。
阅读全文比尔·盖茨:AI危险阈值已过,我们该怎么办?
华盛顿州柯克兰市,一个阳光明媚的日子。这是西雅图富裕的郊区,位于华盛顿湖东岸。气温在华氏80多度(约摄氏30度),天空蓝得不能再蓝。从Gates Ventures的会议室望出去,可以看到Carillon Point码头,那里停泊着一队昂贵的船只,湖对岸是奥林匹克山脉,勾勒出地平线。景色美不胜收,但隐约令人恐惧。因为如果景色是平静的,传递信息的人却不是。坐在我对面的会议室桌旁,比尔·盖茨在椅子上前后
ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent
冷战密码破译巨兽:IBM为NSA打造的Harvest超级计算机
在冷战高峰期,一台极其专业的计算机因其高度机密性,以至于世界根本不知道它的存在。它的运行速度比同时代任何其他计算机快达200倍。从1962年古巴导弹危机时期开始,历经越南战争,直至1975年赫尔辛基协议之后,它一直是美国国家安全局(NSA)的主要密码处理核心。这台机器直到其活动部件最终报废才停止运行。Harvest计算机之所以重要,不仅在于其运行的时代,更在于其本身的特性。在长达14年的时间里,当
LLM智能体利用仿真模型进行受控实验
大型语言模型(LLMs)在推理、规划和工具使用方面展现出强大的能力,但许多科学和工程任务不仅仅需要生成合理的文本和代码。这些任务要求理解系统对干预的响应方式,而这在实践中依赖于受控实验。在本工作中,我们提出了一种多智能体框架,使LLM智能体能够利用科学仿真模型进行受控实验,以用于制药工艺设计。给定用户查询和基线配置,该系统构建结构化的任务表示,设计实验,执行比较仿真,解释结果,并为工艺参数优化综合
美国过半成人自认缺乏基础统计理解能力
根据宾夕法尼亚州立大学研究员领导的一项新研究,许多美国成年人表示,如果他们对统计有更好的理解,他们会更频繁地使用统计。该研究由宾夕法尼亚州立大学健康政策与管理助理研究教授马克·拉莫斯(Mark Ramos)领导。拉莫斯指出,从每日天气预报到棒球运动员的击球率,再到个人患肺癌的风险,理解统计可以帮助美国人更好地应对日常生活。然而,根据拉莫斯领导的最新研究,超过一半的美国成年人表示对基础统计概念知之甚
RENDER:控制LLM记忆评估中的读者可见证据
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风
隐藏规则游戏中的AI学习与概念迁移
本报告总结了在隐藏规则游戏(Game of Hidden Rules, GOHR)上进行的工作,重点关注通过试错反馈推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化能力以及伪机器人辅助的人类学习分析。报告重点介绍了基于Transformer的A2C框架、特征中心(Feature-Centric)和对象中心(Object-Centric)表示、实验结果以及人类学习数据的分类。
AIREP:AI运行时治理中逐决策证据的协议
本文提出了一种用于记录自动化AI运行时治理决策的协议。当运行时对单个输出进行发布、阻止、延迟、编辑或升级处理时,AIREP将该决策记录为单个签名对象,任何一方都可以离线检查该对象,而无需依赖生成该对象的运行时。每条记录将决策表示为在既定政策依据下的封闭动词集合中的一个动词,通过哈希而非值来引用其输入、输出和证据,并声明其证据覆盖的内容以及未覆盖的内容。记录形成SHA-256哈希链,将每条记录绑定到
KVBoost:基于偏差引导重算的分块键值缓存复用技术,实现高效大语言模型推理
基于Transformer的大语言模型(LLM)在推理过程中面临高预填充延迟问题,因为每个请求都需要重新计算键值(KV)张量。现有的前缀缓存系统虽然能降低这一成本,但要求提示词共享一个连续的前缀,这限制了共享内容出现在任意位置时的复用效果。
最新动态
比尔·盖茨:AI危险阈值已过,我们该怎么办?
华盛顿州柯克兰市,一个阳光明媚的日子。这是西雅图富裕的郊区,位于华盛顿湖东岸。气温在华氏80多度(约摄氏30度),天空蓝得不能再蓝。从Gates Ventures的会议室望出去,可以看到Carillon Point码头,那里停泊着一队昂贵的船只,湖对岸是奥林匹克山脉,勾勒出地平线。景色美不胜收,但隐约令人恐惧。因为如果景色是平静的,传递信息的人却不是。坐在我对面的会议室桌旁,比尔·盖茨在椅子上前后
阅读全文ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent
阅读全文冷战密码破译巨兽:IBM为NSA打造的Harvest超级计算机
在冷战高峰期,一台极其专业的计算机因其高度机密性,以至于世界根本不知道它的存在。它的运行速度比同时代任何其他计算机快达200倍。从1962年古巴导弹危机时期开始,历经越南战争,直至1975年赫尔辛基协议之后,它一直是美国国家安全局(NSA)的主要密码处理核心。这台机器直到其活动部件最终报废才停止运行。Harvest计算机之所以重要,不仅在于其运行的时代,更在于其本身的特性。在长达14年的时间里,当
阅读全文LLM智能体利用仿真模型进行受控实验
大型语言模型(LLMs)在推理、规划和工具使用方面展现出强大的能力,但许多科学和工程任务不仅仅需要生成合理的文本和代码。这些任务要求理解系统对干预的响应方式,而这在实践中依赖于受控实验。在本工作中,我们提出了一种多智能体框架,使LLM智能体能够利用科学仿真模型进行受控实验,以用于制药工艺设计。给定用户查询和基线配置,该系统构建结构化的任务表示,设计实验,执行比较仿真,解释结果,并为工艺参数优化综合
阅读全文美国过半成人自认缺乏基础统计理解能力
根据宾夕法尼亚州立大学研究员领导的一项新研究,许多美国成年人表示,如果他们对统计有更好的理解,他们会更频繁地使用统计。该研究由宾夕法尼亚州立大学健康政策与管理助理研究教授马克·拉莫斯(Mark Ramos)领导。拉莫斯指出,从每日天气预报到棒球运动员的击球率,再到个人患肺癌的风险,理解统计可以帮助美国人更好地应对日常生活。然而,根据拉莫斯领导的最新研究,超过一半的美国成年人表示对基础统计概念知之甚
阅读全文RENDER:控制LLM记忆评估中的读者可见证据
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风
阅读全文隐藏规则游戏中的AI学习与概念迁移
本报告总结了在隐藏规则游戏(Game of Hidden Rules, GOHR)上进行的工作,重点关注通过试错反馈推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化能力以及伪机器人辅助的人类学习分析。报告重点介绍了基于Transformer的A2C框架、特征中心(Feature-Centric)和对象中心(Object-Centric)表示、实验结果以及人类学习数据的分类。
阅读全文AIREP:AI运行时治理中逐决策证据的协议
本文提出了一种用于记录自动化AI运行时治理决策的协议。当运行时对单个输出进行发布、阻止、延迟、编辑或升级处理时,AIREP将该决策记录为单个签名对象,任何一方都可以离线检查该对象,而无需依赖生成该对象的运行时。每条记录将决策表示为在既定政策依据下的封闭动词集合中的一个动词,通过哈希而非值来引用其输入、输出和证据,并声明其证据覆盖的内容以及未覆盖的内容。记录形成SHA-256哈希链,将每条记录绑定到
阅读全文KVBoost:基于偏差引导重算的分块键值缓存复用技术,实现高效大语言模型推理
基于Transformer的大语言模型(LLM)在推理过程中面临高预填充延迟问题,因为每个请求都需要重新计算键值(KV)张量。现有的前缀缓存系统虽然能降低这一成本,但要求提示词共享一个连续的前缀,这限制了共享内容出现在任意位置时的复用效果。
阅读全文比尔·盖茨:AI危险阈值已过,我们该怎么办?
华盛顿州柯克兰市,一个阳光明媚的日子。这是西雅图富裕的郊区,位于华盛顿湖东岸。气温在华氏80多度(约摄氏30度),天空蓝得不能再蓝。从Gates Ventures的会议室望出去,可以看到Carillon Point码头,那里停泊着一队昂贵的船只,湖对岸是奥林匹克山脉,勾勒出地平线。景色美不胜收,但隐约令人恐惧。因为如果景色是平静的,传递信息的人却不是。坐在我对面的会议室桌旁,比尔·盖茨在椅子上前后
ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent
冷战密码破译巨兽:IBM为NSA打造的Harvest超级计算机
在冷战高峰期,一台极其专业的计算机因其高度机密性,以至于世界根本不知道它的存在。它的运行速度比同时代任何其他计算机快达200倍。从1962年古巴导弹危机时期开始,历经越南战争,直至1975年赫尔辛基协议之后,它一直是美国国家安全局(NSA)的主要密码处理核心。这台机器直到其活动部件最终报废才停止运行。Harvest计算机之所以重要,不仅在于其运行的时代,更在于其本身的特性。在长达14年的时间里,当
LLM智能体利用仿真模型进行受控实验
大型语言模型(LLMs)在推理、规划和工具使用方面展现出强大的能力,但许多科学和工程任务不仅仅需要生成合理的文本和代码。这些任务要求理解系统对干预的响应方式,而这在实践中依赖于受控实验。在本工作中,我们提出了一种多智能体框架,使LLM智能体能够利用科学仿真模型进行受控实验,以用于制药工艺设计。给定用户查询和基线配置,该系统构建结构化的任务表示,设计实验,执行比较仿真,解释结果,并为工艺参数优化综合
美国过半成人自认缺乏基础统计理解能力
根据宾夕法尼亚州立大学研究员领导的一项新研究,许多美国成年人表示,如果他们对统计有更好的理解,他们会更频繁地使用统计。该研究由宾夕法尼亚州立大学健康政策与管理助理研究教授马克·拉莫斯(Mark Ramos)领导。拉莫斯指出,从每日天气预报到棒球运动员的击球率,再到个人患肺癌的风险,理解统计可以帮助美国人更好地应对日常生活。然而,根据拉莫斯领导的最新研究,超过一半的美国成年人表示对基础统计概念知之甚
RENDER:控制LLM记忆评估中的读者可见证据
记忆与RAG(检索增强生成)评估常常将回答模型的输入视为实现细节,尽管系统可能将相同的历史记录呈现为记忆条目、摘要、类型化记录或原始摘录。我们引入了RENDER,一种基准控制方法,它在固定对话的同时变化读者可见的工件。RENDER结合了五级数据包阶梯(packet ladder),定位答案承载内容进入输入的时间点,并使用确定性模板近似ChatGPT风格的条目、LangChain摘要、MemGPT风
隐藏规则游戏中的AI学习与概念迁移
本报告总结了在隐藏规则游戏(Game of Hidden Rules, GOHR)上进行的工作,重点关注通过试错反馈推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化能力以及伪机器人辅助的人类学习分析。报告重点介绍了基于Transformer的A2C框架、特征中心(Feature-Centric)和对象中心(Object-Centric)表示、实验结果以及人类学习数据的分类。
AIREP:AI运行时治理中逐决策证据的协议
本文提出了一种用于记录自动化AI运行时治理决策的协议。当运行时对单个输出进行发布、阻止、延迟、编辑或升级处理时,AIREP将该决策记录为单个签名对象,任何一方都可以离线检查该对象,而无需依赖生成该对象的运行时。每条记录将决策表示为在既定政策依据下的封闭动词集合中的一个动词,通过哈希而非值来引用其输入、输出和证据,并声明其证据覆盖的内容以及未覆盖的内容。记录形成SHA-256哈希链,将每条记录绑定到
KVBoost:基于偏差引导重算的分块键值缓存复用技术,实现高效大语言模型推理
基于Transformer的大语言模型(LLM)在推理过程中面临高预填充延迟问题,因为每个请求都需要重新计算键值(KV)张量。现有的前缀缓存系统虽然能降低这一成本,但要求提示词共享一个连续的前缀,这限制了共享内容出现在任意位置时的复用效果。