DiffusionGemma:Google の高速テキスト生成モデルが再登場
Google は昨年実験的に公開した Gemini Diffusion モデルの研究を再開し、DiffusionGemma として再発表しました。このモデルは以前 1 秒間に 857 トークンの生成速度を記録しており、テキスト生成の高速化に寄与する技術です。
昨年 5 月、Google は実験的な Gemini Diffusion モデルを短時間だけ公開しました。当時私はそのプレビューを試して 記録を残しています が、その時の処理速度は 1 秒あたり 857 トークンでした。非常に魅力的なモデルでしたが、Google はその後これに関する追加発表を行いませんでした。
しかし、この研究が最善の形で復活しました。新しいオープンウェイト(Apache 2 ライセンス)の Gemma モデルとして登場したのです。それが google/diffusiongemma-26B-A4B-it です。
現在、NVIDIA はこのモデルを自社の NIM クラウド API で 無料でホストしています。私はこの API を使用して、このペリカン(アジサシ)の画像を生成しました。その結果は こちら ですが、生成には 4.4 秒かかりました(time uv run generate.py の計測による)。これは 2,409 トークンを返したことになります。つまり、少なくとも 1 秒あたり 500 トークンの速度です。

Via Hacker News
Tags: google, ai, generative-ai, llms, nvidia, pelican-riding-a-bicycle, gemma, llm-release, llm-performance
原文を表示
Last May Google briefly released an experimental Gemini Diffusion model. I tried the preview at the time and recorded it running at 857 tokens/second. It was an exciting model, but Google made no further announcements about it.
That research has returned in the best possible way: as a new open weight (Apache 2 licensed) Gemma model, google/diffusiongemma-26B-A4B-it.
NVIDIA are currently hosting the model for free on their NIM cloud API. I used that API to generate this pelican, which took 4.4s (according to time uv run generate.py) to return 2,409 tokens - so at least 500 tokens/second.

Via Hacker News
Tags: google, ai, generative-ai, llms, nvidia, pelican-riding-a-bicycle, gemma, llm-release, llm-performance
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み