#LLM30件
#LLM に関連する記事を横断して確認できます。特定テーマの変化を追う入口です。
AI幻覚、米軍作戦の誤作動寸前に
AIによるハルシネーション(幻覚)が、米軍の作戦遂行に影響を及ぼし、誤った判断を誘発しかねない事態が起きたと報じられました。大規模言語モデル(LLM)の不確実性に対する理解の重要性が、専門家から改めて警告されています。
TechCrunch AIPrismML、小型LLMでAI利用を変革へ
新興のAIラボPrismMLが、その独自に開発する小型大規模言語モデル(LLM)によって、AIの利用方法に変革をもたらそうと業界の注目を集めています。同社は、従来のLLMとは異なるアプローチで、より身近で多様な環境でのAI活用を目指しています。
TechCrunch AI資生堂、AIエージェント導入で原料探索を効率化
資生堂ジャパンは、研究開発分野にAIエージェントを導入しました。これにより、化粧品の原料探索プロセスを大幅に効率化。従来、研究員が膨大な候補の中から有望な原料を見極めていた「目利き」の作業をAIで再現し、探索時間を95%削減したと報じられています。
ITmedia AI+
Baseten、DeepSeek-V4.1-FlashをAPIに追加 100万トークン対応
AI推論プロバイダーのBasetenは、DeepSeek-V4.1-Flashを自社のモデルAPIを通じて提供開始しました。このモデルはDeepSeekが開発したマルチモーダルなMoEモデルで、100万トークンという広範なコンテキストウィンドウが特徴です。
Unite.AIMeta「Muse Spark 1.3」推論強化で開発時の対話削減
Metaは、最新のAIモデル「Muse Spark 1.3」を公開しました。このモデルは推論能力が強化されており、開発プロセスにおけるAIとの対話の往復、すなわち手戻りの削減に貢献するとされています。100万トークンのコンテキスト処理やマルチモーダル対応といった既存機能も継承しています。
ITmedia AI+LLMベンチマーク、真の能力を測れているか?
Hugging Faceが、大規模言語モデル(LLM)の性能を評価する既存のベンチマークが、モデルの真の能力を測定できているのかという根本的な疑問を投げかけました。「BenchMIRT」と題された同社のブログ記事では、ベンチマークが抱える課題を深く掘り下げ、より本質的な評価の必要性を強調しています。
Hugging Face BlogAnthropic、新LLM発表 Fable/Mythos 5.1とリスク開示
AI開発のAnthropicは、新しい大規模言語モデル(LLM)『Claude Fable 5.1』と『Claude Mythos 5.1』を発表しました。これらは科学研究やコーディングなどの分野で大幅な性能向上を遂げています。一方で、同社はSystem Cardを通じて、モデルの高度な推論能力に伴う悪用リスクや監視の難しさといった課題についても率直に開示しました。
ITmedia AI+LLM活用課題を乗り越える「ハーネスエンジニアリング」に注目
大規模言語モデル(LLM)を導入した企業が、「生産性が上がらない」「レビューに追われる」といった課題に直面しています。これに対し、AI開発の先行者たちが共通して解決策として挙げるのが「ハーネスエンジニアリング」です。
ITmedia AI+
エージェントAIとは?自律動作の仕組みを解説
近年のAI技術の進化で注目される「エージェントAI」は、単なる情報生成を超え、自律的に目標を追求し達成するシステムです。計画、ツールの活用、状況の観察、そして適応という一連のループを通じて、複雑なタスクをこなします。
Unite.AIAI生成の「存在しない病名」、研修医の約半数が誤信 仏研究
フランスの大学病院の研究者らが、大規模言語モデル(LLM)が生成する架空の病名が医師の診断にどのような影響を与えるかを検証する論文を発表した。この研究では、LLMがもっともらしく提示した存在しない病名を、研修医の44%が信用してしまったことが判明した。
ITmedia AI+
個人PCでLLM活用、プライバシー保護に期待
自身のPCに大規模言語モデル(LLM)をインストールし、AIチャットボットとして利用する手法が広がりを見せています。これにより、利用者は手元のデバイスで便利なデジタルアシスタントを稼働させることが可能になります。
WIRED AI
主要AIモデル、出力の多様性が低下傾向に
米国のデューク大学が実施した新たな研究で、主要なAIモデルが生成する「創造的」な出力が、プロバイダー間で時間とともに類似していることが明らかになりました。この研究は、ユーザーがAIから得られるアイデアの多様性が失われつつある可能性を示唆しています。
Unite.AIAmazon、AI訓練で稀覯本を破棄
かつて書籍販売から始まったAmazonが、AIモデルの訓練データを確保するため、稀覯本を破棄していると報じられました。これは、オンラインで既に利用可能なデータだけでは不足し、大型言語モデル(LLM)の高度な学習には希少なテキストが不可欠であるという背景に基づいています。この行為は、AI開発における倫理的な問題として議論を呼んでいます。
TechCrunch AI
米AI大手、中国勢の追い上げで価格競争
米国の主要AI開発企業であるOpenAIとAnthropicが、中国AI企業の台頭を背景に、生成AIモデルの価格競争を激化させています。両社はより安価なモデルを市場に投入し始め、これまでの高価格帯中心の戦略から転換を図っています。
Ars Technica AI
アンソロピック、AIリスク評価を一段階引き上げ 未公開モデルは棚上げ
アンソロピックは、8月に発表した第2回企業全体リスクレポートで、AIの不整合がもたらす破滅的な損害のリスク評価を「非常に低い」から「低い」へと上方修正しました。また、既存の最先端モデルを上回る能力を持つとされる未公開の内部モデル「Model 2」の公開を棚上げする方針も公表しています。
Unite.AIAnthropic、Claude Fable 5の生物学制限緩和
Anthropicは、AIモデル「Claude Fable 5」において、生物学に関する問い合わせへの過度な安全保護機能を緩和したと発表しました。これにより、安全性を重視するあまり発生していた無害な質問への誤検知や、下位モデルへの切り替えが大幅に削減されます。この緩和は、専門的な二重用途研究への制限は維持しつつ、一般的な健康・教育用途での利用便益を高めるものです。
ITmedia AI+Google、AI活用でChromeバグ修正が急増、6月に過去2年分超
Googleは、AIツールおよび大規模言語モデル(LLM)の活用により、ウェブブラウザChromeのバグ修正に大きな進展があったことを明らかにしました。同社によると、今年6月単月で修正されたバグの数が、過去2年間で修正した合計数を上回ったとのことです。これは、製品開発におけるAIの効果を明確に示す事例となります。
TechCrunch AIAnthropic、新LLM「Claude Opus 5」発表 高性能を半額で
AI企業Anthropicは、最新の大規模言語モデル(LLM)「Claude Opus 5」を発表しました。この新モデルは、同社の上位モデル「Claude Fable 5」に匹敵する高度な知能を持ちながら、その半額で利用できる点が特徴です。特にプログラミングや高度な知識作業において高い性能評価を得ています。
ITmedia AI+
カナダ議員、議会演説でAI生成文を朗読
カナダの国会議員が議会での演説中に、大規模言語モデル(LLM)によって作成されたとみられる文章を読み上げました。これは、AIが政治の公式な場に登場した事例として注目を集めています。
Ars Technica AIOpenAI、オープンウェイトLLMへの警戒と規制議論
AI開発企業OpenAIがオープンウェイトLLMに対し警戒感を募らせています。米国では中国製オープンウェイトLLMの禁止に関する議論が表面化しており、AI技術のビジネス化における根本的な課題が指摘されています。
TechCrunch AIスマホで動く27B級LLM「Bonsai 27B」公開
270億パラメーター規模の高性能な大規模言語モデル(LLM)「Bonsai 27B」が発表されました。このモデルは、iPhoneなどのスマートフォンで直接動作させることが可能なサイズに最適化されている点が特徴です。
ITmedia AI+
悪意あるAI、プロンプトインジェクションで無力化
悪意ある目的で利用されるAIエージェントに対して、プロンプトインジェクション攻撃の一種である「コンテキストボンビング」が有効な防御策として機能していることが明らかになりました。この手法を用いることで、悪意のあるAIは悪事を働く前に停止させられます。
WIRED AIShippy開発から学ぶAIエージェント構築の教訓
Hugging Faceは、独自に開発したAIエージェント「Shippy」の構築プロジェクトから、エージェント開発における貴重な教訓と洞察を得ました。この記事では、その開発過程で直面した具体的な課題や成功体験が共有されています。
Hugging Face BlogGrok 4.5リリース、イーロン・マスクが「Opus級」と評価
イーロン・マスク氏が率いるAI企業は、最新の大規模言語モデルGrok 4.5を発表しました。マスク氏はこの新モデルを「Opus級」と表現しています。他の強力なAIモデルと比較して、より安価かつ効率的な選択肢として提供されるとのことです。
TechCrunch AIVercel CEO、AIモデルとエージェントの分離促す
Vercelのギレルモ・ラウフCEOがTechCrunch AIのインタビューに応じ、AIシステムの本番環境におけるモデルとエージェントの分離が重要であると指摘しました。同氏は、実運用では価格性能比の最適化が不可欠であり、その実現のために両者の独立した設計が必要だと強調しています。
TechCrunch AIAnthropic、AIコーディングの「ループ」4種を分類・解説
Anthropicが、同社のAIモデル「Claude Code」を使ったAIコーディングにおいて、「ループ」と呼ばれる特定の作業プロセスを4種類に分類し、その使い方に関する解説記事を公開した。この分類は、AIにどこまでコーディング作業を委ね、どこで人間が介入すべきかについての理解を深めることを目的としている。
ITmedia AI+
AIブラウザに新攻撃:誤情報でLLMが禁止命令実行の恐れ
AIブラウザにおいて、大規模言語モデル(LLM)の新たな脆弱性を突く攻撃手法が報告されました。
Ars Technica AI
OpenAIとBroadcom、LLM推論用チップ発表
OpenAIとBroadcomが、大規模言語モデル(LLM)の推論処理に特化した新型チップを発表しました。
Ars Technica AILLMの長年のボトルネック、新興Subquadraticが解消を主張
マイアミのAIスタートアップSubquadraticが、LLMの性能を長年阻害してきた数学的ボトルネックを解決したと発表しました。
MIT Technology Review (AI)AIと学生の創造性比較、米大学が2025年実験
米ジョージタウン大学の研究者らが、生成AI(LLM)と人間が生成するアイデアの多様性や創造性を比較検証する論文を発表しました。
ITmedia AI+