<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Elyza on akenji&#39;s lab</title>
    <link>https://akenji3.github.io/tags/elyza/</link>
    <description>Recent content in Elyza on akenji&#39;s lab</description>
    <generator>Hugo</generator>
    <language>ja</language>
    <lastBuildDate>Fri, 03 May 2024 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://akenji3.github.io/tags/elyza/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Elyzaモデルをllama-cpp-pythonを使ってGPUで動かす</title>
      <link>https://akenji3.github.io/post/20240503_llama-cpp-python/</link>
      <pubDate>Fri, 03 May 2024 00:00:00 +0000</pubDate>
      <guid>https://akenji3.github.io/post/20240503_llama-cpp-python/</guid>
      <description>&lt;h2 id=&#34;モチベーション&#34;&gt;モチベーション&lt;/h2&gt;&#xA;&lt;p&gt;LLMを手元のワークステーション（GPUのメモリ12〜16GB）で動かすには量子化が必須となる。この投稿では、llama-cpp-pythonを使って、GPU資源を最大限に活用することに挑戦したので、その内容をまとめる。&lt;/p&gt;&#xA;&lt;p&gt;自分の理解不足のためハマったところもあるので、自分が失敗した箇所も含めた内容となっている。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
