~/home / tags / 研究

# 研究

79 个相关产品 · 中文解读 · 按热度排序
llm-for-zotero
基于Zotero文献库的AI研究代理,能深度理解用户知识库,辅助文献分析与研究写作。
LuaN1aoAgent
LuaN1aoAgent 是一个基于图式认知推理的全自动 AI 渗透测试代理,由高校安全团队研发,能自主发现并利用系统漏洞,面向专业安全研究人员。
xLAM
xLAM 是由Salesforce研究院推出的大型动作模型家族,旨在增强AI代理系统的决策与执行能力,支持多模态、多步骤任务,是AI agent架构层面的重要研究进展。
Open-AgentRL
Open-AgentRL 是一个开源的强化学习框架,支持LLM驱动的AI代理在复杂场景中自主学习与决策,结合RL与工具调用,推动AI代理的自主进化。
SkillOpt
通过轨迹驱动的编辑与验证机制,训练可复用的自然语言技能模块,让冻结的 LLM 代理具备持续进化能力。
Webhound
AI研究代理,允许用户设定研究投入程度(如‘花10分钟’或‘花10小时’),自动决定研究深度并输出相应质量的结论,打破传统研究无终点的困境
Prosed
一个AI书籍服务,能展示其推理过程和来源,让用户看清AI如何得出结论,适合需要透明度的研究者和读者
SurfSense
开源版 NotebookLM 替代品,支持从 Reddit、YouTube、Instagram、TikTok、Google 搜索等平台实时抓取数据,用于研究与内容创作。
A comprehensive, filterable list of AI agent jails
一个可筛选的AI智能体‘监狱’清单,帮助开发者和研究者追踪、测试和管理AI代理在受控环境中的行为,解决AI失控风险与透明度问题,面向AI研究人员与安全工程师。
I ran 70 MCP servers in a sandbox and logged what they do
在沙箱环境中运行 70 个 MCP 服务器并记录其行为,用于分析多代理系统在真实场景下的交互与潜在风险
SpazAI
SpazAI 是一个基于超大规模知识训练的 AI 助手,能回答从商业计划到量子物理等各类问题,适合探索性提问和创意激发。
Signal for LLM – The Modulator Architecture (Theory Complete)
Signal for LLM 是一种理论架构,提出通过「调制器」机制动态控制大模型行为,为 LLM 的可控性与可解释性提供新思路,适合研究者和高级开发者探索模型行为调控。
VetoBench – benchmarking AI memory beyond retrieval
用于评估AI模型在记忆能力上超越检索的基准测试工具,聚焦AI长期记忆与上下文理解能力,面向AI研究者与开发者
A reproducible harness for catching agent-eval cheating
一个可复现的测试框架,用于检测智能体评估中的作弊行为,保障AI代理评测的公平性与可靠性,专为AI研究者与开发者设计;
Remortgaging with Claude, so I built a MCP for Bank of England
用 Claude 分析英国银行的抵押贷款政策并构建了一个 MCP(模型控制协议)工具,帮助用户理解复杂金融规则,适合金融从业者或个人理财者。
ASL V6 – Open-source AST red-teaming engine for Python AI agents
开源的 Python AI 助手对抗性测试引擎,用于模拟攻击并测试 AI 代理在代码生成中的安全漏洞。
Codex Plays NetHack
一个能自主玩《NetHack》游戏的AI代理,通过学习游戏机制和策略自动探索、战斗与生存,为开发者提供AI游戏行为研究与交互实验的范例
ThoughtScope
ThoughtScope 是一个AI驱动的文本分析平台,能深入解析文章与哲学文本,揭示隐藏假设、逻辑矛盾与思想脉络,生成可视化思维图谱。
A sandbox for running real jailbreak techniques against local LLMs
一个用于在本地大模型上测试真实越狱攻击的技术沙盒,帮助研究人员和开发者评估模型安全性,解决AI安全测试缺乏真实场景的问题
Growth-Ratio Energy Function as Leading Indicator of Agent Task Failure
一种用于预测AI智能体任务失败的新型能量函数模型,通过量化任务执行中的不确定性来提前预警,适用于AI系统稳定性优化,供研究人员和AI工程师使用。
ReasonPatch
ReasonPatch 是AI驱动的“思维诊断”工具,能识别学习者在推理过程中的断裂点,通过多AI探针并行验证假设,提供精准的错误分析与修正建议。
Show HN:LoongForge - High-performance training system for embodied models
一个为具身智能模型设计的高性能训练系统,支持复杂物理交互和多模态学习,助力机器人和 AI 代理的训练效率提升。
Nodus
为大学生和研究者打造的桌面端知识管理工具,支持按项目创建独立工作区(vault),整合资料、笔记、数据与想法,避免模板化束缚,提升研究效率。
Delphi Pythia
Delphi Pythia 利用大模型分析公众观点背后的说服力,超越传统问卷与焦点小组,识别真正能改变人们想法的论点,为政策制定与市场策略提供深层洞察。
RootNous
RootNous 是一个专注于计算机视觉、机器学习与机器人等领域的AI研究实验室,致力于产出学术成果与商业化产品。
Lise Science
一个自主研究引擎,能自动阅读文献、提出假设、分析数据并生成可追溯证据链的研究报告,帮助用户进行深度学术探索。
Synthetic PM
AI自动探索任意产品,分析界面结构、功能逻辑并生成报告,替代人工反复点击测试,提升产品调研效率。
asgeirtj/system_prompts_leaks
从多个大模型(Claude、ChatGPT、Gemini、Grok等)中提取系统提示词,揭示模型行为设计逻辑。
Webhound
AI研究引擎,为智能代理提供深度信息检索与分析能力,支持自动化研究工作流
Kannaka Memory
面向AI智能体的波干涉记忆机制,提升长期记忆与推理能力
Signal for LLM – The Modulator Architecture (Theory Complete)
Signal for LLM 是一种基于调制架构的理论模型,旨在通过结构化信号控制大语言模型的推理与输出,提升可控性与可解释性,适合AI研究者与高级开发者使用。
PhysicsThinking
面向物理智能的基准测试平台,评估AI模型在理解物理世界规律(如重力、运动)方面的能力,推动AI向具身智能演进。
VetoBench – benchmarking AI memory beyond retrieval
一个用于评估AI模型记忆能力的基准测试框架,超越传统检索机制,测试模型在复杂上下文中的长期记忆与推理能力,适用于AI研究与模型优化。
Industry Research Framework
为 AI 代理提供基于真实来源的科研框架,确保 AI 输出有据可依,提升研究可信度
HealthResearch.pro
一个探索冷门科技选项的在线研究平台,帮助用户发现未被广泛知晓但可能有价值的前沿技术方案
I ran 70 MCP servers in a sandbox and logged what they do
该项目通过在沙箱中运行 70 个 MCP(多智能体协作协议)服务器,记录并分析其行为,揭示了 AI 智能体在协作、决策与潜在风险方面的实际表现,为 AI 安全与系统设计提供实证研究
Prompt Injection as an Egress Problem
将提示注入(Prompt Injection)视为一种数据外泄(Egress)问题,提出全新视角:大模型的输出可能成为攻击者窃取敏感信息的通道。
The Book of Uncertain Light – A Philosophical Text for LLMs
一本为大型语言模型(LLM)设计的哲学文本,旨在引导 AI 进行更深层的自我反思与认知探索,适合 AI 研究者和伦理开发者。
Isnad – A Python framework that uses 1,200-yearold Islamic logic for AI
Isnad 是一个基于1200年历史伊斯兰逻辑体系的 Python 框架,旨在为 AI 提供可追溯、可验证的推理机制,适合关注 AI 可解释性与伦理可信的开发者与研究者。
Jacobian Fingerprinting in LLM's
Jacobian Fingerprinting 是一种分析LLM内部表征的新方法,通过梯度敏感性检测模型行为指纹,用于模型可解释性与安全研究。
ManjuAi
AI工具,免费运行深度研究与编程代理,支持自动化代码生成与分析,适合开发者和研究者提升效率。
A control-theory approach to detecting LLM agent instability
采用控制理论方法分析和稳定 LLM 代理行为,通过反馈机制检测并抑制代理的发散或异常行为,提升AI代理的可靠性。
Virena, a minimal vision-language-action robot model you can read
Virena 是一个可读的极简视觉-语言-动作机器人模型,通过自然语言理解与视觉输入生成动作指令,适合研究人员和开发者探索具身智能的可解释性。
Decypher-env, an RL Env for breaking AES encryption
Decypher-env 是一个用于强化学习的环境,目标是让 AI 模型学习破解 AES 加密,用于研究密码学安全性和 AI 攻击能力边界。
Siora AI
Siora AI 是一个智能研究型聊天工具,能理解复杂问题并主动推进调研流程
Cognir Research
一个面向研究者的智能研究启动平台,整合文献检索、笔记整理与知识管理功能,提升科研效率。
WorldFoundry
一个开源的全能型AI系统框架,支持世界模型构建、基础设施部署、推理与评估,面向AI研发团队和研究者,具备模块化与可扩展性优势
FoundationAgents/OpenManus
OpenManus项目,强调开放协作的AI研究与开发平台,致力于打造无壁垒的AI基础设施,推动AI民主化
cognizant-ai-lab/neuro-san-studio
神经符号AI实验平台,用于探索神经网络与符号推理的融合,适合AI研究者进行创新性实验。
BruceDevices/firmware
针对 ESP32 的恶意固件,可被用于设备劫持或数据窃取,警示开发者注意物联网设备安全风险。
What different cultures agree on about leadership
该研究分析全球不同文化对领导力的共识,揭示跨文化领导力的核心特质,为全球化团队管理提供洞察。
A Transformer Is All You Need PT 2L: Precision Brain Surgery
A Transformer Is All You Need PT 2L 是对经典 Transformer 模型的深度剖析,聚焦于模型内部的「精确推理机制」,适合想理解大模型工作原理
Excogni – open, pseudonymous cognitive measurement in the making
Excogni 是一个开源的、伪匿名的认知测量框架,旨在在保护用户隐私的前提下收集和分析认知行为数据,适合研究者与隐私敏感型 AI 产品团队。
Sourclip
将 NotebookLM 转化为完整研究工作流的生产力工具,支持自动整理资料、生成大纲与引用,适合研究人员、内容创作者与学生
Delphi Pythia
研究型分析平台,用于量化评估哪些论点真正能改变他人观点,适用于政策制定、公共传播与辩论策略研究
I Built a Capture the Flag Arena for Agents
我构建了一个用于 AI Agent 的 CTF 比赛场域,让多个智能体在对抗环境中竞争与学习,适合 AI 研究者与开发者测试 Agent 的策略与鲁棒性,亮点是提供可复现的智能体博
3,225 trials of LLMs guessing author age – confident and wrong
该项目对 3225 个 LLM 模型进行测试,分析它们在判断作者年龄时的自信程度与准确性,揭示了大模型在社会属性判断上的系统性偏差。
Benchmarklist: track AI benchmarks (2.4k+), models, and capabilities
Benchmarklist 是一个开源的 AI 模型性能追踪平台,汇集了超过 2.4k 个 AI 基准测试、模型与能力对比,帮助研究者和开发者快速评估和比较不同模型的实际表现;
We hid a backdoor in an LLM – $51,200 on finding it
一个故意在大模型中植入后门的实验项目,通过悬赏5.1万美元激励安全研究人员发现漏洞,揭示 LLM 安全风险;
I made a Strava for logging degen trades on WSB
A sandbox for running real jailbreak techniques against local LLMs 是一个用于测试大模型安全边界的实验性沙盒环境,
Favur Evals – evals of our agent harness, explore and control replays
Favur Evals 是一个用于评估智能体框架(agent harness)的工具,支持回放、探索与控制实验结果,专为 AI 研究者和开发者设计,提升智能体开发的可观察性与可复现
A model-routing benchmark – the routers optimize the wrong axis
一个用于评估大模型路由策略的基准测试工具,揭示当前路由算法在优化错误指标上的问题,帮助研究者和开发者改进模型调度效率。
RL Environment for Sheep Hearding
一个用于训练AI牧羊犬行为的强化学习环境,专为研究智能体在动态群体控制中的决策能力设计,适合AI研究人员与机器人开发者
East Asia Insights
东亚太地区政要档案库,收录该区域议会成员信息,提供政治人物背景与履职数据,助力研究与新闻报道
A self-correcting algebraic agent swarm
一个能自我修正的代数智能体集群,通过分布式协作与纠错机制实现复杂逻辑推理,适合研究AI协作与自动验证的开发者和研究人员。
Growth-Ratio Energy Function as Leading Indicator of Agent Task Failure
一种基于增长比率的能量函数,可作为智能体任务失败的早期预警指标,用于提升AI系统可靠性与稳定性。
A comprehensive, filterable list of AI agent jails
一个可过滤的 AI 代理监狱(AI agent jail)综合列表,用于研究和测试 AI 代理的行为边界与安全性,适合安全研究人员和 AI 开发者
langchain-ai/open_deep_research
LangChain团队开源的深度研究项目,聚焦大模型在复杂研究任务中的应用,适合AI研究人员和高级开发者,亮点是前沿探索与开放协作
Point-in-time datasets of prediction-market event probabilities
提供预测市场事件概率的时间点快照数据集,可用于研究市场行为、预测模型验证与金融行为分析
OnlyFans Statistics
OnlyFans Statistics 是开源项目,提供可引用的创作者经济数据,包含 10 万条免费数据集,帮助研究者和内容创作者分析平台趋势与收入模式。
Surfacing gaps in neuroscience and narrative insights in Final Fantasy
该项目通过分析《最终幻想》游戏叙事,揭示神经科学中的认知空白,是跨学科研究的创新尝试,适合对游戏叙事与脑科学交叉研究者。
A browser universe simulator with reproducible scientific state
这是一个可复现的浏览器宇宙模拟器,能精确还原浏览器运行状态并用于科学研究,适合前端开发者与浏览器研究员,亮点是实现高度可复现的浏览器行为仿真。
kritt.ai
开源AI安全研究基础设施,支持构建和测试AI驱动的攻防实验环境
PokerLLM
开源项目,让多个AI模型在德州扑克中对战,用于研究AI策略、博弈论与决策能力,适合AI研究人员与开发者
Research Space Navigator
Research Space Navigator 是生产力工具,帮助 AI 研究者跳出思维定式,避免在复杂研究中陷入“表示陷阱”,提升创新效率。
slavakurilyak/awesome-ai-agents
汇集 300+ 个 AI 代理相关资源的精选清单,涵盖工具、框架、论文与案例,是 AI 代理领域的知识导航地图
MODSetter/SurfSense
SurfSense 是开源版 NotebookLM,支持实时抓取 Reddit、YouTube、TikTok、Google 搜索等开放网络数据,通过统一平台或 MCP 服务进行研究
objectionary/eo
基于 φ-演算的实验性纯面向对象编程语言 EOLANG,探索编程范式的新边界,适合研究型开发者和语言爱好者。
Finola
提升金融研究可靠性与可验证性的工具,帮助投资者和分析师更可信地进行决策。
其他标签