大家好,
我是恩智浦生成式人工智能& LLMs 论坛的开发人员,最近我开始在 i.MX95 EVK 上探索 eIQ GenAI Flow 演示器。我成功地从 AppCodeHub 代码库中克隆了演示版,并开始在 Yocto 环境中进行交叉编译,但途中遇到了一些障碍。我知道你需要兼容的电路板支持包和可选的元层,具体视版本而定。
此外,我还对 人工智能 ai推理性能有何不同。我已经看到基准测试表明,在中子加速的情况下,iMx95的代币生成速度约为9个代币/高效密码学标准(SEC),而在仅使用iMx8MP CPU的情况下,代币生成速度约为8.7个代币/高效密码学标准(SEC) @github .com。但我很想听到第一手反馈,尤其是已经在这些平台上使用 RAG 和 LLM 管道的开发人员的反馈。
问题
哪个版本的电路板支持包(例如为了顺利部署,我的目标是 L6.12.20 还是 L6.12.3?
在 i.MX95 A1 和 B0 修订版上成功启用 Neutron 有什么技巧?
在 eIQ GenAI Flow 下使用 RAG 的实时推理延迟和内存限制经验?
希望在我继续努力之前,能得到任何建议,特别是配置说明或经验教训。
提前感谢!
嗨,@Alicecarry、
感谢您的留言!
让我来回答您的问题。
要使电路板支持包版本与 GenAI Flow Demonator v1.1 一起使用,我们建议使用 L6.12.20。在这个电路板支持包上,i.MX95 B0 不再需要所提供的元层,因为它已经包括通过中子核处理器的内置LLM加速。只有在自定义 L6.12.3 电路板支持包 时才需要元层来支持 i.MX95 A1 上的 LLM 加速。
对于 i.MX95 A1 版本,您有两种利用 Neutron 的选择:
uuu 闪烁映像时,请使用标准 imx-image-full-imx95evk.wic ,但 必须使用 特定的 imx-boot 用于 A1 版本。此文件包含在 BSP 版本存档中,名为:imx-boot-imx95-a1-19x19-lpddr5-evk-sd.bin-flash_a55dm-eiq-genai-flow-demonstrator/meta-eiq-genai-flow/recipes-libraries/neutron/files/NeutronFwllm.elf。将其复制到i.MX95 EVK 文件系统上的 /lib/firmware/ 。请注意,无论如何你都需要在闪存之后在 u-启动 中设置 " Neutron " dtb。
该演示器仅展示了我们内部能力的一部分。在内部,我们还有额外的 ASR 和 LLM 模型,可针对特定用例对延迟和性能进行微调。例如,使用 Whisper-small.en ASR 和 Danube-500M (q8) LLM,我们实现了"Time to First Audio (TTFA)"--输入语音结束与输出语音开始之间的延迟约为 3.5 秒,这对于许多使用案例来说都是可以接受的。
使用其他 ASR 模型,我们可以通过 LLM 将 TTFA 缩短到 3秒以下 ,而在仅 RAG 模式下(不使用 LLM),我们可以将 TTFA 缩短到 2秒以下。
希望对您有所帮助!
再次感谢,
Pierre