Mohammad Raouf Abedini
人工智能安全研究 · 大语言模型代理红队测试 · 攻击性与防御性安全工程
安全研究员,专注于测量和遏制前沿人工智能的网络能力,现可搬迁。相关工作公开、经过签名且可复现:一个开源的遏制证明框架、五篇带 DOI 存档的 Zenodo 预印本(已在 ORCID 下编入索引),以及在 Anthropic 安全评估项目内的评估工作。
Project Simurgh 的创建者——一个与提供方无关的遏制证明框架,在对抗性的、不诚实生产者威胁模型下对大语言模型代理进行红队测试,并生成经 Ed25519 签名、可离线验证的证据,记录代理在护栏失效后的行为:针对真实的 Llama Guard 4 遏制了 138/138 个分类器漏检的案例,在 AgentDojo 上将实时代理的攻击成功率从 9/140 降至 0/140,以及五个经机器验证的 Lean 定理。AGPL-3.0,3,057 项测试。
同时也是《The Invisible Window》的主要作者(100% 跨平台屏幕捕获规避,已依据 OWASP/FIRST/CISA 指南负责任地披露)以及《Aion-BibleQA》(面向检索增强大语言模型的引用忠实度基准:R@5 为 0.941,零无依据引用)的作者。在 Anthropic 的安全评估项目中(通过 Alignerr,2026 年)评估了 Claude 输出的可利用代码与护栏绕过情况。一家孵化器支持的校园人工智能初创公司的联合创始人。致力于通过测量能力提升、界定安全边界以及交付防御性工具来降低高级人工智能带来的灾难性风险。

专业领域
漏洞研究与披露
- 跨平台漏洞开发(Win32 API、macOS ScreenCaptureKit)
- 负责任披露(OWASP/FIRST/CISA 框架)
- IEEE 格式安全研究
- 渗透测试与安全代码审查
- W3C Screen Capture 规范
人工智能安全与大语言模型安全
- 大语言模型集成与评估(Claude,经 Alignerr)
- 人工智能辅助漏洞研究
- 人工智能能力提升测量
- 双重用途风险评估
- 意图与产物安全边界界定
Python 与系统编程
- Python(主要)、C、C++、TypeScript、Swift
- 高性能 C/C++ 系统(100 万+ 操作/秒)
- 网络数据包处理(libpcap)
- Linux(Ubuntu/Kali)、CMake、Docker
- GitHub Actions CI/CD、Google Test
攻击性安全
- 威胁建模(MITRE ATT&CK、OWASP Top 10)
- 网络入侵检测系统
- Wireshark、Nmap、Burp Suite
- 基于 NLP 的钓鱼模拟
- NIST 框架与合规
技能矩阵
活跃运营
教育背景
网络安全学士
2024–2026Macquarie University · WAM 76.27
数字取证 · 网络安全 · 系统安全 · NLP与机器学习 · 隐私保护数据分析 · 云计算
信息技术文凭
2023–2024Macquarie University · WAM 71.75
系统、网络和软件工程基础。